VRAM別ベンチマーク

VRAM 24GB で動くモデル

VRAM 24GB のGPUで実測したローカルLLMを、生成速度や量子化方式から比較できます。

← 全ベンチマークへ戻る

生成速度グラフ

VRAM 24GB の tokens/sec 比較
tokens/secLlama 3.1 8B (Q8_0) — RTX 4090 / llama.cpp72.4Qwen2.5 14B (Q4_K_M) — RTX 4090 / vllm24.7

比較表

列見出しで並べ替え、backend と GPU の選択欄で絞り込みができます。

ローカルLLMの実測ベンチマーク比較表
Llama 3.1 8BQ8_0RTX 409024llama.cpp72.48,1922026-03-03全レイヤーをGPUへオフロード(暫定値)
Qwen2.5 14BQ4_K_MRTX 409024vllm24.716,3842026-04-02単一リクエスト時の生成速度(暫定値)