ローカルLLM・GPU 実測ベンチマーク
モデル、量子化方式、GPU、実行バックエンドごとの生成速度を比較できます。数値は検証中の暫定データです。
生成速度グラフ
比較表
列見出しで並べ替え、backend と GPU の選択欄で絞り込みができます。
| Gemma 2 2B | Q4_K_M | RTX 4060 | 8 | llama.cpp | 108.3 | 4,096 | 2026-05-22 | — |
| Llama 3.2 3B | Q4_K_M | RTX 4060 | 8 | ollama | 94.5 | 8,192 | 2026-05-06 | 標準設定での3回平均(暫定値) |
| Phi-3.5-mini | Q4_K_M | RTX 4060 Ti | 16 | ollama | 78.2 | 8,192 | 2026-04-19 | — |
| Llama 3.1 8B | Q8_0 | RTX 4090 | 24 | llama.cpp | 72.4 | 8,192 | 2026-03-03 | 全レイヤーをGPUへオフロード(暫定値) |
| Qwen2.5 32B | Q4_K_M | RTX 5090 | 32 | ollama | 45.2 | 16,384 | 2026-06-10 | 受け入れ基準実証用に追加した1エントリ(暫定値) |
| rnj-1:8b | Q4_K_M | RTX 4060 Ti | 16 | ollama | 41.8 | 8,192 | 2026-02-14 | ウォームアップ後の3回平均(暫定値) |
| Mistral 7B | Q4_K_M | RTX 3060 | 12 | lm-studio | 37.9 | 8,192 | 2026-03-18 | — |
| Llama 3.1 8B | Q4_K_M | RTX 3060 | 12 | ollama | 33.6 | 8,192 | 2026-02-21 | — |
| Qwen2.5 14B | Q4_K_M | RTX 4090 | 24 | vllm | 24.7 | 16,384 | 2026-04-02 | 単一リクエスト時の生成速度(暫定値) |