日本語に強いローカルLLMはどう選ぶ?まず自分の用途で試す
日本語対応という表記や公開ベンチマークだけでモデルを決めず、文章作成、要約、質問応答など自分の用途を2〜3個に絞り、同じ条件で候補を試す方法を解説します。
新着順に読む、local-genの記事。全268件。
日本語対応という表記や公開ベンチマークだけでモデルを決めず、文章作成、要約、質問応答など自分の用途を2〜3個に絞り、同じ条件で候補を試す方法を解説します。
日本語ローカルLLMを自分の用途で比較するために、実際の仕事から10件ほどのテストケースを作り、正解または採点基準、機密情報の扱い、バージョンを保存する方法を整理します。
大型GPUを購入する前に、カード寸法、占有スロット、補助電源、電源ユニット、ケーブルの余裕、ケース内の通風、GPUの支え方をメーカー仕様で照合する手順をまとめます。
llama.cppで役割名がそのまま出る、system指示が効かないなど会話形式が崩れるときに、GGUFメタデータ、自動選択されたchat template、上書き設定、raw promptを順に比較する方法を整理します。
llama.cppで長いコンテキストを使うとき、モデル側の上限、-c/--ctx-size、KV cacheのデータ型、KVのGPU配置を分けて確認し、必要な長さまで段階的に増やす方法を整理します。
llama.cppのGPUバックエンドを、名前の印象や速度ランキングではなく、使っているGPU、OS、公式対応、配布済みバイナリの有無、自分でビルドする必要性から選ぶ方法を整理します。
llama.cppでJSONを安定して出力したいときに、GBNF grammarやJSON Schemaで構文を制約する方法と、その制約では保証できない内容の正しさを分けて整理します。
llama.cppで複数GPUを使うとき、split-mode、tensor-split、main-gpuなどの設定を、同じGGUFとコンテキスト長で比較する方法を整理します。VRAMを単純に合算せず、実際の配置と速度をログで確認します。
llama.cppの--n-gpu-layersでモデル層をどこまでGPUへ置くか調整するときに、数値・auto・allの意味、起動ログ、VRAM、KV cache、コンテキスト長を分けて確認する方法を整理します。
llama.cppのtemperature・top-p・min-pを一度に調整せず、同じモデル、プロンプト、seedで基準を作り、一項目ずつ変えて出力の違いを確認する方法を整理します。
llama.cppのllama-serverへGGUFを指定し、localhostで起動して/healthを確認し、最初のHTTPリクエストを送るまでを整理します。最初は外部ネットワークへ公開せず、ローカル動作だけを切り分けます。
Llamaの小型モデルを、Llamaという名前だけでまとめず、世代、1B・3Bなどのモデル規模、Instruct版かどうか、ライセンス、コンテキスト長、配布物、実行環境から選ぶ方法を整理します。
LM Studioでコンテキスト長を変更するときに、モデル側の上限と実際に使う長さを分け、メモリ使用量を確認しながら必要な範囲まで増やす方法を整理します。
LM Studioで複数モデルを使うとき、必要時だけ読み込むJIT loadingと、使っていないモデルを解放する自動unloadを、読み込み待ちとVRAM・RAMの空き容量から選ぶ方法を整理します。
LM Studioを同じLANの別PCやタブレットから使うときに、待受先、API token、Windows Firewall、接続を許可するネットワークを確認し、必要な範囲だけへ公開する方法を整理します。
LM StudioをGUIなしで常用したいときに、llmsterとデスクトップ版のheadless運用を区別し、daemonの起動、モデル読み込み、停止、再起動、ログ確認まで進める方法を整理します。
LM StudioのAPIを自作アプリなどから使うときに、まずlocalhostだけでサーバーを起動し、モデル一覧と1回の応答を確認する手順を整理します。LAN公開やAPI tokenは必要になってから追加します。
LM Studioの検索結果からモデルを選ぶときに、配布元、元モデル、ファイル形式、量子化、容量を確認し、ダウンロード前にモデルカードとライセンスへ戻る手順を整理します。