ДомЛаб

Сколько VRAM нужно для локального AI

Разбираем, из чего складывается потребление видеопамяти — веса, KV-кэш и накладные расходы — и сколько гигабайт реально нужно под разные задачи.

2 мин чтенияРедакция ДомЛаб
Иллюстрация к статье: Сколько VRAM нужно для локального AI

Вопрос «сколько нужно видеопамяти» звучит просто, но ответ зависит от трёх слагаемых, и второе из них регулярно ломает планы.

Из чего складывается VRAM

Веса модели. Считаются прямо: количество параметров умножить на байты на параметр. Модель на 14 миллиардов параметров в Q4_K_M занимает примерно 14 × 0,61 ≈ 8,5 ГБ.

KV-кэш. Память под контекст. Растёт линейно с числом токенов и не зависит от квантизации весов. На 32K контекста у 32B-модели это легко 8–10 ГБ — то есть больше, чем половина весов.

Накладные расходы. CUDA-контекст, буферы, активации — от 0,5 до 2 ГБ в зависимости от бэкенда и размера батча.

Посчитать всё вместе для конкретной связки «модель + квантизация + контекст» можно в калькуляторе VRAM.

Сколько нужно под задачу

ЗадачаМинимумКомфорт
Чат, короткие тексты8 ГБ12 ГБ
Русскоязычные тексты, длинный контекст12 ГБ16 ГБ
Программирование12 ГБ24 ГБ
Работа с документами и RAG16 ГБ24 ГБ
Генерация изображений8 ГБ16 ГБ
Модели 70B48 ГБ64 ГБ+

Что делать, если памяти не хватает

Порядок действий примерно такой — от самого безболезненного к самому заметному:

  1. Уменьшить контекст. Часто 8K вместо 32K освобождает несколько гигабайт без всякого ущерба.
  2. Квантовать KV-кэш. Q8 для кэша экономит вдвое и почти не влияет на качество ответов.
  3. Взять квантизацию ниже. Q5 вместо Q6, потом Q4.
  4. Взять модель поменьше. 8B в Q5 обычно приятнее в работе, чем 14B в Q3.
  5. Выгрузить часть слоёв в RAM. Работает, но скорость падает в несколько раз.

Учитывайте, что видеопамять занимает и операционная система: браузер с десятком вкладок и рабочий стол съедают 0,5–1,5 ГБ. Планируйте бюджет не от полного объёма карты, а от свободного.

Практический вывод

На 2026 год разумный минимум для локального AI — 12 ГБ. Золотая середина — 16 ГБ: сюда помещаются 14B в хорошей квантизации с длинным контекстом и 24–27B в Q4. Всё, что выше 24 ГБ, нужно уже под конкретные сценарии — модели 32B в Q6, длинный контекст или несколько параллельных пользователей.