3B・4Bと7B・8BのローカルLLMはどう選ぶ?
3B・4Bと7B・8Bはモデル規模の目安ですが、数字だけで品質・速度・必要メモリは決まりません。必要な機能、ライセンス、配布ファイル、実行環境を確認し、自分の同じ質問セットで小さいモデルから比較する方法を整理します。
新着順に読む、local-genの記事。全715件。
3B・4Bと7B・8Bはモデル規模の目安ですが、数字だけで品質・速度・必要メモリは決まりません。必要な機能、ライセンス、配布ファイル、実行環境を確認し、自分の同じ質問セットで小さいモデルから比較する方法を整理します。
LM Studio・Ollama・llama.cppなどのローカルAPIへcurlで最初のリクエストを送るときに、ベースURL、エンドポイント、モデルID、JSON、認証、ストリーミングを分けて確認する手順を整理します。
ローカルLLM APIのストリーミングを実装するときに、受信途中のデータ、画面表示用のバッファー、確定した回答、正常終了、エラー、通信切断、利用者によるキャンセルを分けて扱う方法を整理します。
ローカルLLMの回答をモデル名を隠してA/B比較する方法を解説します。プロンプトや生成条件、評価基準をそろえ、自分の用途でどちらの回答を選ぶかを公平に確かめます。
公開ベンチマークだけでモデルを決めず、普段使う作業を代表する質問、採点基準、実行条件を固定して候補を比較する方法を解説します。モデル名を隠す比較や記録方法も使い、後から同じ条件で再評価できる形にします。
LM StudioやOllamaの構造化出力を使うときに、JSON Schemaへの一致、JSON解析、値の妥当性、再試行を分けて確認する方法を整理します。形式が正しいだけで実行可能と判断せず、アプリ側で最後に検証します。
ローカルLLMのツール呼び出しを、1回成功したかだけで判断せず、正しいツール選択、引数、不要な呼び出し、拒否、複数段階の処理に分けて評価する方法を整理します。外部サービスの成否とモデルの出力も分離します。
モデルが返したツール名と引数をそのまま実行せず、JSON解析、引数の形式、許可されたツールか、利用者や作業に権限があるかを確認してから実行する方法を整理します。最初は副作用のないツールで安全に試します。
会議録をローカルで作るときに、録音の許諾、文字起こし、話者分離、時刻情報による対応付け、人による確認を分けて進める方法を整理します。まず短い許諾済み音声で話者と時刻のずれを確認します。
日本語PDFをローカルOCRするときに、文字情報を持つPDFかスキャン画像か、日本語の認識データ、縦書き、段組み、表、出力形式を分けて確認する方法を整理します。難しいページを含む代表例で原文と照合します。
ローカルRAGを継続運用するときに、元文書のフォルダーを正本とし、追加、内容更新、名前変更、削除、索引の再作成、バックアップを分けて確認する方法を整理します。自動同期を前提にせず、一つずつ反映を確かめます。
ローカルRAGは、手元の文書から質問に関係する部分を検索し、その内容をLLMへ渡して回答を作る仕組みです。モデル自体を追加学習する方法との違いを、文書解析・分割・埋め込み・検索・回答生成の5段階から整理します。
動画生成用GPUを選ぶときに、VRAM容量だけでなく、使う動画モデル、フレーム数、解像度、精度、CPUへのオフロード、実測値をそろえて候補を絞る方法を整理します。静止画用のVRAM目安をそのまま流用しません。
動画の音声をローカルで文字起こしし、時刻情報、字幕の区切り、改行、SRT・VTTへの書き出し、動画上でのずれ確認まで進める手順を整理します。文字起こし結果をそのまま完成字幕にはせず、実際の映像で読みやすさを確認します。
テキストから動画を作るT2Vと、開始画像へ動きを付けるI2Vの違いを整理します。入力画像を用意するか、構図やキャラクターの初期状態をどこまで自分で決めたいか、必要なモデルや処理手順、PC条件から最初の方式を選びます。
ローカルで画像を扱うVision LLMを選ぶときに、モデル自体の画像対応、mmprojなどの補助ファイル、実行環境の対応、画像の入力方法、メモリ条件を分けて確認します。モデル名にVisionやVLと付いているだけで判断しません。
音声を外部サービスへ送らずに文字起こししたいとき、音声形式、Whisper系モデルと実行環境、言語、時刻情報、出力形式を確認し、短い音声から試す方法を整理します。出力は原音と照合し、固有名詞や数字を確認します。
最大コンテキスト長の数字だけで長文性能を判断せず、文書の長さ、重要情報の位置、要約、離れた箇所の参照、入力の切り捨てを分けて評価する方法を整理します。自分が実際に使う文書で安定する長さを確認します。