Benchmark方針

更新 2026/09/02

ベンチマークはlocal-gen.jpの信頼性を支える独立データです。数字だけを並べず、再現に必要な条件とRaw evidenceを同じrun IDで追跡します。

必須の測定条件

  • 測定日時、run ID、反復回数、warmup条件
  • GPU、GPU数、VRAM、CPU、RAM、OS、driver
  • 実行runtime、exact version、backend、関連option
  • model ID、publisher、exact revision、format、量子化、model file identity
  • context長、prompt/input条件、output条件、sampling条件
  • methodology ID/versionと測定項目の定義・単位
  • Raw log、command/config、machine metadata、Source、review状態

測れない値の扱い

測れない項目を0や推定値で埋めません。metricはmeasurednot_measuredunavailableを区別し、unavailableでは理由を残します。

file sizeはrequired VRAM/RAMではなく、load-only memoryもpeak runtime memoryではありません。CPU/partial offloadをfull GPU fitと表現せず、publisher/vendor値をlocal-gen実測値として扱いません。

出典区分

local-gen.jpが条件を固定して測定した値はmeasured、第三者が測定し条件を追跡できる値はthird_party_measuredとします。計算・推定した値はestimatedであり、実測表へ混ぜません。

runnerがexit code 0で終了しても、その時点ではRaw evidenceです。数値、条件、単位、provenanceをreviewし、Production Benchmark summaryとEvidence manifestが1:1で一致したrecordだけを公開データとして扱います。

現在の状態

現在公開している検証済み実測と測定条件は、ベンチマーク一覧で確認できます。公開件数はKnowledgeの追加・見直しに伴って変わるため、この方針ページには固定しません。

schemaは特定GPUやOSへ固定しません。methodology、Raw log保存、fixture分離、review/publish境界を維持し、架空の速度・TTFT・peak VRAM・電力値で画面を埋めません。

サイト内検索