2件の実測測定方針 →
2 / 2 実測GPU・モデル・runtimeが一致する実測記録だけを絞り込みます。速度の優劣は条件を揃えず推定しません。
2026/08/23

GeForce RTX 5090

Qwen2.5-7B-Instruct / Q8_0 / コンテキスト 512トークン

llama.cpp b10336
Prompt
16,314.71 t/s
Generation
182.22 t/s
測定条件と記録を見る
コンテキスト長
512トークン
Prompt tokens
512
Generation tokens
128
Repetitions
5
Run ID
batch002-rtx5090-qwen2-5-q8-0-20260823-001
Model revision
bb5d59e06d9551d752d08b292a50eb208b07ab1f
CUDA
13.3

この値はllama-benchのthroughput測定です。TTFT、peak VRAM/RAM、電力、温度などは測定していない限り表示しません。

2026/08/23

GeForce RTX 5090

Qwen2.5-7B-Instruct / Q4_K_M / コンテキスト 512トークン

llama.cpp b10336
Prompt
14,743.55 t/s
Generation
262.24 t/s
測定条件と記録を見る
コンテキスト長
512トークン
Prompt tokens
512
Generation tokens
128
Repetitions
5
Run ID
batch001-rtx5090-qwen2-5-q4-k-m-20260823-001
Model revision
bb5d59e06d9551d752d08b292a50eb208b07ab1f
CUDA
13.3

この値はllama-benchのthroughput測定です。TTFT、peak VRAM/RAM、電力、温度などは測定していない限り表示しません。

サイト内検索