Какую LLM я могу запустить
Выберите видеокарту — покажем, какие модели поместятся в память, в какой квантизации и насколько быстро будут отвечать.
При 16 ГБ и контексте 8 192 токенов запускается 15 из 20 моделей списка.
| Модель | Квантизация | Память | ~Скорость | Вердикт |
|---|---|---|---|---|
Qwen3 14B Qwen | Q6_K | 13.5 ГБ | 30 tok/s | ✅ Запустится с запасом |
Qwen3 8B Qwen | Q8_0 | 10.2 ГБ | 42 tok/s | ✅ Запустится с запасом |
Llama 3.1 8B Llama | Q8_0 | 9.8 ГБ | 43 tok/s | ✅ Запустится с запасом |
Gemma 3 4B Gemma | FP16 / BF16 | 10.0 ГБ | 42 tok/s | ✅ Запустится с запасом |
Qwen3 4B Qwen | FP16 / BF16 | 9.5 ГБ | 45 tok/s | ✅ Запустится с запасом |
Qwen3 1.7B Qwen | FP16 / BF16 | 5.0 ГБ | 106 tok/s | ✅ Запустится с запасом |
Qwen3 30B-A3B (MoE) Qwen | Q3_K_M | 15.3 ГБ | 228 tok/s | 🟡 Впритык — уменьшите контекст |
Mistral Small 3 24B Mistral | Q4_K_M | 15.6 ГБ | 25 tok/s | 🟡 Впритык — уменьшите контекст |
gpt-oss 20B (MoE) OpenAI | Q5_K_M | 15.3 ГБ | 139 tok/s | 🟡 Впритык — уменьшите контекст |
DeepSeek-R1-Distill-Qwen 14B DeepSeek | Q6_K | 13.8 ГБ | 30 tok/s | 🟡 Впритык — уменьшите контекст |
Qwen2.5-Coder 14B Qwen | Q6_K | 13.7 ГБ | 30 tok/s | 🟡 Впритык — уменьшите контекст |
Phi-4 14B Microsoft | Q6_K | 13.7 ГБ | 30 tok/s | 🟡 Впритык — уменьшите контекст |
Gemma 3 12B Gemma | Q8_0 | 16.0 ГБ | 28 tok/s | 🟡 Впритык — уменьшите контекст |
Mistral Nemo 12B Mistral | Q8_0 | 14.2 ГБ | 28 tok/s | 🟡 Впритык — уменьшите контекст |
Qwen2.5-Coder 7B Qwen | FP16 / BF16 | 15.5 ГБ | 24 tok/s | 🟡 Впритык — уменьшите контекст |
Qwen3 32B Qwen | Q3_K_M | 17.6 ГБ | — | ⚠️ Только с выгрузкой в RAM (медленно) |
DeepSeek-R1-Distill-Qwen 32B DeepSeek | Q3_K_M | 17.6 ГБ | — | ⚠️ Только с выгрузкой в RAM (медленно) |
Qwen2.5-Coder 32B Qwen | Q3_K_M | 17.5 ГБ | — | ⚠️ Только с выгрузкой в RAM (медленно) |
Gemma 3 27B Gemma | Q3_K_M | 17.1 ГБ | — | ⚠️ Только с выгрузкой в RAM (медленно) |
Llama 3.3 70B Llama | — | 35.0 ГБ | — | ❌ Не поместится |
Расчёт оценочный: берётся лучшая квантизация, которая помещается в память вместе с KV-кэшем (F16) и накладными расходами. Реальное потребление зависит от бэкенда (llama.cpp, Ollama, vLLM), флагов и того, что ещё занимает видеопамять — например, рабочий стол.
