Сколько VRAM нужно для локального AI
Разбираем, из чего складывается потребление видеопамяти — веса, KV-кэш и накладные расходы — и сколько гигабайт реально нужно под разные задачи.

Вопрос «сколько нужно видеопамяти» звучит просто, но ответ зависит от трёх слагаемых, и второе из них регулярно ломает планы.
Из чего складывается VRAM
Веса модели. Считаются прямо: количество параметров умножить на байты на параметр. Модель на 14 миллиардов параметров в Q4_K_M занимает примерно 14 × 0,61 ≈ 8,5 ГБ.
KV-кэш. Память под контекст. Растёт линейно с числом токенов и не зависит от квантизации весов. На 32K контекста у 32B-модели это легко 8–10 ГБ — то есть больше, чем половина весов.
Накладные расходы. CUDA-контекст, буферы, активации — от 0,5 до 2 ГБ в зависимости от бэкенда и размера батча.
Посчитать всё вместе для конкретной связки «модель + квантизация + контекст» можно в калькуляторе VRAM.
Сколько нужно под задачу
| Задача | Минимум | Комфорт |
|---|---|---|
| Чат, короткие тексты | 8 ГБ | 12 ГБ |
| Русскоязычные тексты, длинный контекст | 12 ГБ | 16 ГБ |
| Программирование | 12 ГБ | 24 ГБ |
| Работа с документами и RAG | 16 ГБ | 24 ГБ |
| Генерация изображений | 8 ГБ | 16 ГБ |
| Модели 70B | 48 ГБ | 64 ГБ+ |
Что делать, если памяти не хватает
Порядок действий примерно такой — от самого безболезненного к самому заметному:
- Уменьшить контекст. Часто 8K вместо 32K освобождает несколько гигабайт без всякого ущерба.
- Квантовать KV-кэш. Q8 для кэша экономит вдвое и почти не влияет на качество ответов.
- Взять квантизацию ниже. Q5 вместо Q6, потом Q4.
- Взять модель поменьше. 8B в Q5 обычно приятнее в работе, чем 14B в Q3.
- Выгрузить часть слоёв в RAM. Работает, но скорость падает в несколько раз.
Учитывайте, что видеопамять занимает и операционная система: браузер с десятком вкладок и рабочий стол съедают 0,5–1,5 ГБ. Планируйте бюджет не от полного объёма карты, а от свободного.
Практический вывод
На 2026 год разумный минимум для локального AI — 12 ГБ. Золотая середина — 16 ГБ: сюда помещаются 14B в хорошей квантизации с длинным контекстом и 24–27B в Q4. Всё, что выше 24 ГБ, нужно уже под конкретные сценарии — модели 32B в Q6, длинный контекст или несколько параллельных пользователей.
