ローカルLLM・GPU 実測ベンチマーク

モデル、量子化方式、GPU、実行バックエンドごとの生成速度を比較できます。数値は検証中の暫定データです。

生成速度グラフ

全ベンチマークの tokens/sec 比較
tokens/secGemma 2 2B (Q4_K_M) — RTX 4060 / llama.cpp108.3Llama 3.2 3B (Q4_K_M) — RTX 4060 / ollama94.5Phi-3.5-mini (Q4_K_M) — RTX 4060 Ti / ollama78.2Llama 3.1 8B (Q8_0) — RTX 4090 / llama.cpp72.4Qwen2.5 32B (Q4_K_M) — RTX 5090 / ollama45.2rnj-1:8b (Q4_K_M) — RTX 4060 Ti / ollama41.8Mistral 7B (Q4_K_M) — RTX 3060 / lm-studio37.9Llama 3.1 8B (Q4_K_M) — RTX 3060 / ollama33.6Qwen2.5 14B (Q4_K_M) — RTX 4090 / vllm24.7

比較表

列見出しで並べ替え、backend と GPU の選択欄で絞り込みができます。

ローカルLLMの実測ベンチマーク比較表
Gemma 2 2BQ4_K_MRTX 40608llama.cpp108.34,0962026-05-22
Llama 3.2 3BQ4_K_MRTX 40608ollama94.58,1922026-05-06標準設定での3回平均(暫定値)
Phi-3.5-miniQ4_K_MRTX 4060 Ti16ollama78.28,1922026-04-19
Llama 3.1 8BQ8_0RTX 409024llama.cpp72.48,1922026-03-03全レイヤーをGPUへオフロード(暫定値)
Qwen2.5 32BQ4_K_MRTX 509032ollama45.216,3842026-06-10受け入れ基準実証用に追加した1エントリ(暫定値)
rnj-1:8bQ4_K_MRTX 4060 Ti16ollama41.88,1922026-02-14ウォームアップ後の3回平均(暫定値)
Mistral 7BQ4_K_MRTX 306012lm-studio37.98,1922026-03-18
Llama 3.1 8BQ4_K_MRTX 306012ollama33.68,1922026-02-21
Qwen2.5 14BQ4_K_MRTX 409024vllm24.716,3842026-04-02単一リクエスト時の生成速度(暫定値)