Как запустить нейросеть локально — пошаговое руководство
Полный маршрут от нулевой установки до работающего чата с LLM на своём компьютере: выбор софта, модели, квантизации и настройка контекста.

Локальная нейросеть — это языковая модель, которая работает на вашем компьютере: без интернета, без подписки и без отправки переписки в чужое облако. Ниже — маршрут, который занимает 15–20 минут и заканчивается работающим чатом.
Что нужно от компьютера
Главный ресурс — не «мощность» видеокарты, а объём видеопамяти. Модель должна поместиться в VRAM целиком, иначе часть слоёв уедет в оперативную память и скорость упадёт в разы.
| VRAM | Что реально запускается |
|---|---|
| 8 ГБ | Модели до 8B в Q4, короткий контекст |
| 12 ГБ | 8–14B в Q4–Q5 |
| 16 ГБ | 14B комфортно, 24–27B впритык |
| 24 ГБ | 27–32B в Q4 с большим контекстом |
| 32 ГБ+ | 32B в Q6/Q8, MoE-модели |
Не уверены в цифрах для своей карты — посмотрите в калькуляторе «Какую LLM я могу запустить»: он считает веса, KV-кэш и накладные расходы вместе.
Видеокарта не обязательна: на процессоре модели тоже работают, просто медленно — 3–8 токенов в секунду против 40–80 на GPU. Для «спросить и подождать» этого хватает, для потокового ассистента — нет.
Шаг 1. Выбрать программу
Есть два массовых варианта, и оба бесплатны.
Ollama — консольная утилита с сервером на порту 11434. Ставится одной командой, модели тянет своей командой, отдаёт OpenAI-совместимый API, к которому подключается почти всё: Open WebUI, VS Code, Home Assistant.
LM Studio — приложение с графическим интерфейсом. Каталог моделей встроен, квантизации видно в списке, есть чат и такой же локальный сервер. Порог входа ниже, гибкости меньше.
Если планируете подключать локальную LLM к другим сервисам — берите Ollama. Если хотите просто чат — LM Studio.
Шаг 2. Установить Ollama
curl -fsSL https://ollama.com/install.sh | shНа Windows и macOS ставится обычным установщиком с сайта. После установки проверьте, что сервис поднялся:
ollama --versionШаг 3. Скачать модель
Начните с чего-то небольшого — так вы быстро поймёте, укладывается ли железо.
ollama run qwen3:8bПервый запуск скачает около 5 ГБ и сразу откроет чат в терминале. Модель отвечает по-русски, держит контекст и не требует интернета после загрузки.
Разумные стартовые варианты:
- Qwen3 8B — универсальная, хорошо знает русский;
- Gemma 3 12B — сильна в текстах, понимает изображения;
- Qwen2.5-Coder 14B — для кода;
- Llama 3.1 8B — классика, много готовых интеграций.
Шаг 4. Разобраться с квантизацией
Квантизация — сжатие весов модели. Обозначается как Q4_K_M, Q5_K_M, Q8_0 и так далее: чем меньше число, тем меньше файл и тем сильнее просадка качества.
- Q8_0
- Практически неотличимо от оригинала, но вдвое больше
- Q6_K
- Очень близко к FP16
- Q5_K_M
- Хороший баланс
- Q4_K_M
- Рабочий стандарт для дома
- Q3_K_M
- Только если иначе не влезает
Практическое правило: модель побольше в Q4 почти всегда лучше, чем модель поменьше в Q8. 14B в Q4_K_M обыгрывает 8B в Q8 на большинстве задач при том же объёме памяти.
Шаг 5. Настроить контекст
Контекст — сколько текста модель держит в памяти. Он стоит видеопамяти: KV-кэш растёт линейно, и на длинном контексте может занять больше, чем сами веса.
ollama run qwen3:8b --ctxsize 16384По умолчанию многие сборки ставят контекст 4096 токенов. Если модель «забывает» начало разговора — дело почти всегда в этом, а не в самой модели.
Шаг 6. Добавить нормальный интерфейс
Терминал — не самый удобный чат. Open WebUI поднимается в Docker одной командой и даёт интерфейс, похожий на привычные облачные сервисы: история, папки, загрузка документов, несколько моделей.
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:mainПосле запуска откройте http://localhost:3000, зарегистрируйте первого пользователя — он станет
администратором — и выберите модель из списка.
Что делать дальше
- подключить локальную модель к VS Code как ассистента для кода;
- отдать ей документы через RAG и получить поиск по своей базе знаний;
- связать с Home Assistant и управлять умным домом голосом без облака;
- посчитать в калькуляторе VRAM, какая модель влезет при нужном контексте.
Главный вывод: локальный AI перестал быть развлечением для энтузиастов. Модель на 14B параметров в 2026 году закрывает большую часть повседневных задач, а всё, что для этого нужно, — видеокарта с 12–16 ГБ памяти и двадцать минут на настройку.
