ДомЛаб

Как запустить нейросеть локально — пошаговое руководство

Полный маршрут от нулевой установки до работающего чата с LLM на своём компьютере: выбор софта, модели, квантизации и настройка контекста.

обновлено 1 сентября 2026 г.4 мин чтенияРедакция ДомЛаб
Иллюстрация к статье: Как запустить нейросеть локально — пошаговое руководство

Локальная нейросеть — это языковая модель, которая работает на вашем компьютере: без интернета, без подписки и без отправки переписки в чужое облако. Ниже — маршрут, который занимает 15–20 минут и заканчивается работающим чатом.

Что нужно от компьютера

Главный ресурс — не «мощность» видеокарты, а объём видеопамяти. Модель должна поместиться в VRAM целиком, иначе часть слоёв уедет в оперативную память и скорость упадёт в разы.

VRAMЧто реально запускается
8 ГБМодели до 8B в Q4, короткий контекст
12 ГБ8–14B в Q4–Q5
16 ГБ14B комфортно, 24–27B впритык
24 ГБ27–32B в Q4 с большим контекстом
32 ГБ+32B в Q6/Q8, MoE-модели

Не уверены в цифрах для своей карты — посмотрите в калькуляторе «Какую LLM я могу запустить»: он считает веса, KV-кэш и накладные расходы вместе.

Видеокарта не обязательна: на процессоре модели тоже работают, просто медленно — 3–8 токенов в секунду против 40–80 на GPU. Для «спросить и подождать» этого хватает, для потокового ассистента — нет.

Шаг 1. Выбрать программу

Есть два массовых варианта, и оба бесплатны.

Ollama — консольная утилита с сервером на порту 11434. Ставится одной командой, модели тянет своей командой, отдаёт OpenAI-совместимый API, к которому подключается почти всё: Open WebUI, VS Code, Home Assistant.

LM Studio — приложение с графическим интерфейсом. Каталог моделей встроен, квантизации видно в списке, есть чат и такой же локальный сервер. Порог входа ниже, гибкости меньше.

Если планируете подключать локальную LLM к другим сервисам — берите Ollama. Если хотите просто чат — LM Studio.

Шаг 2. Установить Ollama

curl -fsSL https://ollama.com/install.sh | sh

На Windows и macOS ставится обычным установщиком с сайта. После установки проверьте, что сервис поднялся:

ollama --version

Шаг 3. Скачать модель

Начните с чего-то небольшого — так вы быстро поймёте, укладывается ли железо.

ollama run qwen3:8b

Первый запуск скачает около 5 ГБ и сразу откроет чат в терминале. Модель отвечает по-русски, держит контекст и не требует интернета после загрузки.

Разумные стартовые варианты:

  • Qwen3 8B — универсальная, хорошо знает русский;
  • Gemma 3 12B — сильна в текстах, понимает изображения;
  • Qwen2.5-Coder 14B — для кода;
  • Llama 3.1 8B — классика, много готовых интеграций.

Шаг 4. Разобраться с квантизацией

Квантизация — сжатие весов модели. Обозначается как Q4_K_M, Q5_K_M, Q8_0 и так далее: чем меньше число, тем меньше файл и тем сильнее просадка качества.

Q8_0
Практически неотличимо от оригинала, но вдвое больше
Q6_K
Очень близко к FP16
Q5_K_M
Хороший баланс
Q4_K_M
Рабочий стандарт для дома
Q3_K_M
Только если иначе не влезает

Практическое правило: модель побольше в Q4 почти всегда лучше, чем модель поменьше в Q8. 14B в Q4_K_M обыгрывает 8B в Q8 на большинстве задач при том же объёме памяти.

Шаг 5. Настроить контекст

Контекст — сколько текста модель держит в памяти. Он стоит видеопамяти: KV-кэш растёт линейно, и на длинном контексте может занять больше, чем сами веса.

ollama run qwen3:8b --ctxsize 16384

По умолчанию многие сборки ставят контекст 4096 токенов. Если модель «забывает» начало разговора — дело почти всегда в этом, а не в самой модели.

Шаг 6. Добавить нормальный интерфейс

Терминал — не самый удобный чат. Open WebUI поднимается в Docker одной командой и даёт интерфейс, похожий на привычные облачные сервисы: история, папки, загрузка документов, несколько моделей.

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main

После запуска откройте http://localhost:3000, зарегистрируйте первого пользователя — он станет администратором — и выберите модель из списка.

Что делать дальше

  • подключить локальную модель к VS Code как ассистента для кода;
  • отдать ей документы через RAG и получить поиск по своей базе знаний;
  • связать с Home Assistant и управлять умным домом голосом без облака;
  • посчитать в калькуляторе VRAM, какая модель влезет при нужном контексте.

Главный вывод: локальный AI перестал быть развлечением для энтузиастов. Модель на 14B параметров в 2026 году закрывает большую часть повседневных задач, а всё, что для этого нужно, — видеокарта с 12–16 ГБ памяти и двадцать минут на настройку.