ДомЛаб

Какую LLM я могу запустить

Выберите видеокарту — покажем, какие модели поместятся в память, в какой квантизации и насколько быстро будут отвечать.

При 16 ГБ и контексте 8 192 токенов запускается 15 из 20 моделей списка.

МодельКвантизацияПамять~СкоростьВердикт
Qwen3 14B
Qwen
Q6_K13.5 ГБ30 tok/s Запустится с запасом
Qwen3 8B
Qwen
Q8_010.2 ГБ42 tok/s Запустится с запасом
Llama 3.1 8B
Llama
Q8_09.8 ГБ43 tok/s Запустится с запасом
Gemma 3 4B
Gemma
FP16 / BF1610.0 ГБ42 tok/s Запустится с запасом
Qwen3 4B
Qwen
FP16 / BF169.5 ГБ45 tok/s Запустится с запасом
Qwen3 1.7B
Qwen
FP16 / BF165.0 ГБ106 tok/s Запустится с запасом
Qwen3 30B-A3B (MoE)
Qwen
Q3_K_M15.3 ГБ228 tok/s🟡 Впритык — уменьшите контекст
Mistral Small 3 24B
Mistral
Q4_K_M15.6 ГБ25 tok/s🟡 Впритык — уменьшите контекст
gpt-oss 20B (MoE)
OpenAI
Q5_K_M15.3 ГБ139 tok/s🟡 Впритык — уменьшите контекст
DeepSeek-R1-Distill-Qwen 14B
DeepSeek
Q6_K13.8 ГБ30 tok/s🟡 Впритык — уменьшите контекст
Qwen2.5-Coder 14B
Qwen
Q6_K13.7 ГБ30 tok/s🟡 Впритык — уменьшите контекст
Phi-4 14B
Microsoft
Q6_K13.7 ГБ30 tok/s🟡 Впритык — уменьшите контекст
Gemma 3 12B
Gemma
Q8_016.0 ГБ28 tok/s🟡 Впритык — уменьшите контекст
Mistral Nemo 12B
Mistral
Q8_014.2 ГБ28 tok/s🟡 Впритык — уменьшите контекст
Qwen2.5-Coder 7B
Qwen
FP16 / BF1615.5 ГБ24 tok/s🟡 Впритык — уменьшите контекст
Qwen3 32B
Qwen
Q3_K_M17.6 ГБ⚠️ Только с выгрузкой в RAM (медленно)
DeepSeek-R1-Distill-Qwen 32B
DeepSeek
Q3_K_M17.6 ГБ⚠️ Только с выгрузкой в RAM (медленно)
Qwen2.5-Coder 32B
Qwen
Q3_K_M17.5 ГБ⚠️ Только с выгрузкой в RAM (медленно)
Gemma 3 27B
Gemma
Q3_K_M17.1 ГБ⚠️ Только с выгрузкой в RAM (медленно)
Llama 3.3 70B
Llama
35.0 ГБ Не поместится

Расчёт оценочный: берётся лучшая квантизация, которая помещается в память вместе с KV-кэшем (F16) и накладными расходами. Реальное потребление зависит от бэкенда (llama.cpp, Ollama, vLLM), флагов и того, что ещё занимает видеопамять — например, рабочий стол.