gpt-oss-20bとは? 21B/3.6BのMoE構成と16GBメモリ案内
gpt-oss-20bは総20.91B・有効3.61Bパラメータ、131,072トークンのコンテキストを持つOpenAIのオープンウェイトMoEモデル。MXFP4のチェックポイントは12.8GiBで、OpenAIは16GBメモリのシステムでも動かせると案内している。
新着順に読む、local-genの記事。全268件。
gpt-oss-20bは総20.91B・有効3.61Bパラメータ、131,072トークンのコンテキストを持つOpenAIのオープンウェイトMoEモデル。MXFP4のチェックポイントは12.8GiBで、OpenAIは16GBメモリのシステムでも動かせると案内している。
ローカルLLMがVRAMに収まらない場合は、コンテキスト削減、量子化変更、モデル縮小を確認したうえでpartial offloadを検討できる。オフロードはCPUとRAMを使って起動条件を広げる方法で、GPU内に全量を置く場合と同じ速度を保証するものではない。
今のPCで電源・ケース・RAMなどをそのまま使えるなら、GPU交換は有力な選択肢。追加交換が増えて費用や手間が大きくなるなら、PC全体の買い替えと総額で比べたい。現状で困っていなければ何も買わない選択も残る。
LLMはモデル本体とは別に、過去トークンのKey/Valueを再利用するKVキャッシュへ実行時メモリを使う。コンテキストを長くするほどキャッシュも増えるため、最大コンテキストと実際に使う長さは分けて考えたい。
LFM2.5-2.6BはLiquid AIの追加学習済み小型モデルで、モデルカード上の総パラメータ数は2.69B、最大コンテキストは131,072トークン。GGUF・ONNX・MLXを含む公式配布経路があり、日本語も対応言語として記載されている。
Windows + NVIDIAでllama.cppを使うなら、まず公式配布バイナリを確認し、必要な場合だけGGML_CUDA=ONでsource buildする。GGUFの読み込みとCUDAデバイス認識、GPU配置は別々に確認する。
コンテキストは長いほど良いわけではない。32K・128K・256K・1Mは、モデルの通常対応、条件付き拡張、ランタイムの初期値を分け、実際の入力・会話履歴・出力に必要な長さから選ぶ。
モデルファイルのGB表示は保存容量であり、そのまま必要VRAMを示すものではない。VRAM、RAM、KVキャッシュなどを含む実行時メモリを分け、量子化・ランタイム・コンテキスト・オフロード条件からPC適合性を判断する。
LM StudioでGPU使用率が低い、CPUだけで動いているように見える場合は、まずGPU offloadと現在の配置を確認する。次にGPU選択・バックエンド・VRAM・コンテキスト・モデル対応を順番に切り分ける。
Hugging FaceのGGUFは、LM Studioのモデル検索・URL指定から取得する方法と、手元のGGUFをローカル登録する方法がある。配布元・元モデル・量子化を確認し、読み込み後にコンテキストとGPU設定を確認する。
Windows版LM Studioを公式サイトから導入し、モデルを1つダウンロードして読み込み、短い返答を得るまでの最短手順。GPU offloadやコンテキスト調整は初回起動後に行う。
ローカルAI用BTO PCは、CPUのグレードより先に用途とGPU/VRAMを決める。次にRAMとSSD、電源・冷却、保証を見れば、必要な構成と削れる部分を判断しやすい。
使いたいGPUが用途と予算を満たし、必要な時期が決まっているなら購入を検討しやすい。今のPCで困っていないなら、値下がりを当てにするのではなく再評価日と買う条件を決めて待つ。
ローカルAI PCは「予算の何%をGPUへ」という固定比率では決めにくい。使うモデルと実行条件を満たすGPU/VRAMを確保し、RAM・SSD・電源・冷却の不足を埋めてから、余る予算の使い道を考える。
常用モデルを少数に絞るなら1TB、複数のLLMや画像生成モデルを手元に置くなら2TB、動画モデルや生成物まで大量に保存するなら4TBが候補。実際のファイル容量と増設しやすさから決めたい。
LM Studio・Ollama・llama.cpp serverはいずれもOpenAI互換APIを提供するが、対応エンドポイントや状態保持、ツール機能は同一ではない。アプリが必要とするAPI契約から接続先を選ぶ。
ローカルLLMのOOMはVRAM容量だけでは決まらない。まずコンテキストとKVキャッシュを見直し、次に量子化・モデルサイズ、GPU/CPUオフロードを確認し、それでも不足するときにハードウェアを検討する。
モデルの大部分をGPUへ載せ、同時作業も軽いなら32GBから検討できる。CPUオフロードや長いコンテキスト、開発環境の併用が増えるなら64GB、RAMを大量に使う具体的な用途や増設できない構成では128GBが候補になる。