VRAM別ベンチマーク
VRAM 24GB で動くモデル
VRAM 24GB のGPUで実測したローカルLLMを、生成速度や量子化方式から比較できます。
← 全ベンチマークへ戻る生成速度グラフ
比較表
列見出しで並べ替え、backend と GPU の選択欄で絞り込みができます。
| Llama 3.1 8B | Q8_0 | RTX 4090 | 24 | llama.cpp | 72.4 | 8,192 | 2026-03-03 | 全レイヤーをGPUへオフロード(暫定値) |
| Qwen2.5 14B | Q4_K_M | RTX 4090 | 24 | vllm | 24.7 | 16,384 | 2026-04-02 | 単一リクエスト時の生成速度(暫定値) |