Ollama: установка, команды и выбор локальной модели
Что такое Ollama, как установить и запустить модель, выбрать вариант для русского языка, подключить Open WebUI, Docker и локальный API.

Содержание статьи— 30 разделов
Ollama — локальный runtime и сервер для языковых моделей. Он скачивает подготовленные версии моделей из Ollama Library, запускает их одной командой и предоставляет API на локальном порту 11434. Простейший старт после установки выглядит так:
ollama run qwen3:8bКоманда скачает модель, если её ещё нет, загрузит в память и откроет диалог в терминале. Для домашнего сервера Ollama удобна тем, что работает фоном, подключается к Open WebUI, Python, LangChain и другим клиентам.
Ollama: что это и зачем нужна
Ollama AI объединяет несколько задач:
- скачивание локальных моделей по имени и тегу;
- запуск на CPU, GPU или в смешанном режиме;
- CLI-чат без отдельного интерфейса;
- локальный HTTP API;
- управление загруженными и установленными моделями;
- создание собственных вариантов через Modelfile;
- генерацию embeddings для RAG и поиска.
Ollama нейросетью не является: это среда выполнения. Ответ генерирует конкретная модель — Qwen, Gemma, Llama, DeepSeek или другая. Поэтому запрос «Ollama плохо отвечает по-русски» сначала требует проверить модель, её размер, системный промпт и квантизацию.
Ollama работает на macOS, Windows и Linux. Локальные запросы и ответы не нужно отправлять в облако. При этом современные версии также могут поддерживать облачные модели и внешние функции; для строго локального режима их можно отключить.
Установка Ollama
Скачивайте программу с официального сайта. После установки откройте терминал и проверьте:
ollama --versionWindows
Установщик добавляет приложение и CLI. Сервис запускается в пользовательской сессии, а команды доступны в PowerShell и Windows Terminal. Если команда не найдена сразу после установки, закройте и заново откройте терминал.
macOS
Установите приложение, переместите его в Applications и запустите. На Apple Silicon модели используют объединённую память. Свободный объём меньше номинального, потому что память нужна и macOS.
Linux
Официальная документация предлагает установочный скрипт:
curl -fsSL https://ollama.com/install.sh | shПеред выполнением удалённого скрипта разумно открыть URL и проверить источник. После установки Ollama обычно запускается как systemd service. Статус можно проверить так:
systemctl status ollamaЕсли HomeLab работает в контейнерах, ниже есть отдельный раздел Docker Ollama. Не устанавливайте одновременно несколько экземпляров на один порт, пока не определили, какой из них будет основным.
Как запустить Ollama и первую модель
Откройте Ollama Library, выберите семейство и точный тег. Затем выполните:
ollama run qwen3:8bВ интерактивном чате введите вопрос. Для выхода используйте:
/byeЕсли модель уже скачана, повторный запуск не загружает веса из сети. Чтобы только скачать файл без чата:
ollama pull qwen3:8bНе путайте имя семейства и тег. Команды ollama run qwen3 и ollama run qwen3:8b могут указывать на один вариант сегодня, но тег latest способен измениться. Для воспроизводимого сервера фиксируйте конкретный размер или digest и проверяйте обновления отдельно.
Основные Ollama команды
| Задача | Команда |
|---|---|
| Запустить модель | ollama run qwen3:8b |
| Скачать без запуска | ollama pull qwen3:8b |
| Показать модели на диске | ollama ls |
| Показать модели в памяти | ollama ps |
| Остановить модель | ollama stop qwen3:8b |
| Удалить модель | ollama rm qwen3:8b |
| Запустить сервер вручную | ollama serve |
| Создать вариант из Modelfile | ollama create my-model -f Modelfile |
В старых инструкциях и поисковых формулировках встречается ollama list, но актуальная CLI reference использует ollama ls. Всегда сверяйте команды через:
ollama --helpКоманда Ollama serve нужна, если сервер не запущен приложением или службой. Не запускайте второй процесс поверх уже занятого порта.
Ollama модели: как выбрать подходящую
Выбор начинается не с рейтинга, а с четырёх ограничений:
- Задача. Общий чат, код, рассуждения, анализ изображения или embeddings требуют разных моделей.
- Память. Веса, контекст и параллельные запросы должны помещаться в RAM/VRAM.
- Язык. Модель нужно отдельно проверить на русских инструкциях и фактах.
- Лицензия. У семейств и производных вариантов различаются условия использования.
Практическая стартовая лестница:
| Доступная память | С чего начать | Для чего подходит |
|---|---|---|
| 8 ГБ | 1B–4B | быстрые команды, классификация, простой чат |
| 12 ГБ | 7B–8B в умеренной квантизации | домашний ассистент, русский текст, базовый код |
| 16 ГБ | 8B–14B | более устойчивые ответы и длиннее контекст |
| 24 ГБ | 14B–32B в зависимости от квантизации | сложный код, RAG, рассуждения |
| 48 ГБ+ | крупные 32B–70B варианты | тяжёлые сценарии и несколько пользователей |
Это ориентиры, а не гарантия. Размер контекста и конкретная архитектура меняют потребление. Проверить расчёт можно в калькуляторе VRAM.
После запуска выполните:
ollama psПоле PROCESSOR показывает, загружена ли модель полностью на GPU, полностью на CPU или разделена между ними. Если часть весов ушла в RAM, скорость может заметно снизиться.
Ollama модели для русского языка
Для русского языка чаще выбирают современные многоязычные instruct-модели. В библиотеке стоит проверить семейства Qwen, Gemma и производные reasoning-модели на основе многоязычных архитектур. Название семейства само по себе не гарантирует качество конкретного тега.
Сделайте небольшой локальный тест:
- попросите исправить русский текст без изменения смысла;
- задайте вопрос с неоднозначной формулировкой;
- проверьте соблюдение JSON-формата;
- попросите сослаться на фрагмент вашего документа;
- сравните галлюцинации на фактах, которых нет в промпте;
- измерьте скорость на одинаковом контексте.
Для домашнего RAG нужна отдельная embedding-модель. В Ollama Library доступны, например, Qwen3 Embedding, EmbeddingGemma и другие специализированные варианты. Генеративную модель не стоит автоматически использовать для векторного поиска только потому, что она хорошо пишет текст.
Подробнее о принципе такого поиска: эмбеддинги и векторные базы.
Где находится Ollama Library
Ollama Library — официальный каталог модельных пакетов. На странице семейства видны доступные теги, размер файла, контекст, тип входных данных и команды запуска.
Перед загрузкой проверьте:
- полный тег модели;
- размер скачивания;
- поддержку tools, vision или embeddings;
- дату обновления;
- базовую модель и лицензию;
- описание конкретного варианта.
Большое число загрузок не доказывает, что модель лучше для вашего русского текста. Популярность часто отражает возраст и упоминания в старых инструкциях.
Ollama WebUI: подключение Open WebUI
У Ollama есть CLI и API, но для браузерных чатов, истории, пользователей и документов удобен отдельный интерфейс. Популярная связка — Ollama Open WebUI.
Схема простая:
браузер → Open WebUI → Ollama API → локальная модельЕсли оба сервиса запущены на одном хосте без контейнеров, WebUI обращается к http://localhost:11434. В Docker слово localhost внутри контейнера указывает на сам контейнер, поэтому используют имя сервиса или адрес хоста.
Полная установка и настройка разобрана в материале Open WebUI: локальный интерфейс для нейросетей.
Запросы Ollama WebUI, WebUI Ollama, Ollama Open WebUI и Open WebUI Ollama описывают одну связку, а не четыре разных продукта.
Ollama Docker и Docker Compose
Официальный CPU-контейнер можно запустить так:
docker run -d \
-v ollama:/root/.ollama \
-p 127.0.0.1:11434:11434 \
--name ollama \
ollama/ollamaПривязка к 127.0.0.1 не публикует API на всех сетевых интерфейсах. Для доступа из другого контейнера используйте общую Docker network и имя ollama.
Минимальный Ollama Docker Compose:
services:
ollama:
image: ollama/ollama
container_name: ollama
restart: unless-stopped
volumes:
- ollama-data:/root/.ollama
ports:
- "127.0.0.1:11434:11434"
volumes:
ollama-data:Для NVIDIA GPU официальный образ требует NVIDIA Container Toolkit и параметр GPU. Для AMD используется отдельный вариант ROCm, а Vulkan включается отдельной настройкой. Не добавляйте устройства вслепую: сначала сверяйте поддержку вашей видеокарты в актуальной документации Ollama.
После запуска контейнера модель можно вызвать так:
docker exec -it ollama ollama run qwen3:8bOllama API и порт 11434
По умолчанию локальный сервер слушает 127.0.0.1:11434. Простой запрос к API:
curl http://localhost:11434/api/chat -d '{
"model": "qwen3:8b",
"messages": [
{"role": "user", "content": "Ответь одним предложением: что такое NAS?"}
],
"stream": false
}'Ollama port не следует открывать напрямую в интернет: локальный API рассчитан на доверенное окружение и сам по себе не заменяет полноценный шлюз авторизации. Для домашней сети ограничьте firewall, используйте reverse proxy с аутентификацией или VPN.
Чтобы слушать другой интерфейс, задают OLLAMA_HOST. На Linux для systemd переменную добавляют через override службы, на Windows — через пользовательские переменные среды с перезапуском приложения.
Python Ollama, LangChain и n8n
Для Python существует официальный клиентский пакет, а HTTP API можно вызывать любой библиотекой. LangChain Ollama используют как локальный LLM-компонент или источник embeddings. В n8n Ollama подключают к AI-узлам для автоматизаций.
Перед интеграцией проверьте три вещи:
- клиент видит сервер по правильному адресу;
- модель уже скачана;
- таймаут достаточен для первого холодного запуска.
Не передавайте внешнему workflow доступ ко всему локальному API без авторизации. Особенно опасны сценарии, где ответ модели автоматически запускает команды или изменяет данные.
Ollama create и Modelfile
Modelfile позволяет задать базовую модель, системный промпт и параметры. Пример:
FROM qwen3:8b
PARAMETER temperature 0.3
SYSTEM Ты локальный помощник по домашней инфраструктуре. Если не уверен, скажи об этом.Создание варианта:
ollama create domlab-assistant -f Modelfile
ollama run domlab-assistantЭто не дообучение весов. Ollama create собирает повторяемую конфигурацию поверх базовой модели. Храните Modelfile в репозитории, чтобы настройки можно было воспроизвести.
Где хранятся модели Ollama
Официальная документация указывает стандартные пути:
- macOS:
~/.ollama/models; - Linux:
/usr/share/ollama/.ollama/models; - Windows:
C:\Users\%username%\.ollama\models.
Чтобы перенести хранилище, задайте OLLAMA_MODELS. На Linux пользователь службы ollama должен иметь права чтения и записи в новую папку. Не переносите отдельные blob-файлы вручную во время работы сервиса — остановите его и переносите каталог целиком.
Как удалить модель или Ollama
Чтобы удалить модель Ollama и освободить место:
ollama rm qwen3:8bСначала выполните ollama ls и скопируйте точное имя. Запрос «как удалить модель Ollama» не следует путать с полным удалением приложения.
Как удалить Ollama целиком, зависит от операционной системы и способа установки. Остановите сервис, удалите приложение штатным способом и только затем решайте, нужен ли каталог моделей. Веса могут занимать сотни гигабайт и не всегда удаляются вместе с программой.
Ollama vs LM Studio
Ollama vs LM Studio — выбор интерфейса и способа эксплуатации:
- LM Studio удобнее для визуального поиска GGUF и ручных экспериментов;
- Ollama удобнее как фоновый сервис, API и backend для WebUI;
- LM Studio показывает отдельные квантизованные файлы;
- Ollama упаковывает модель и параметры в собственные теги;
- обе системы могут использовать близкие локальные runtime и похожие модели.
Если вы не уверены, установите обе и сравните одну модель на одинаковом промпте. Подробная инструкция: LM Studio — установка и первый запуск.
Частые проблемы
Ollama работает только на CPU
Выполните ollama ps во время генерации. Проверьте совместимость GPU, драйвер и контейнерный runtime. Если модель не помещается целиком, возможно смешанное размещение CPU/GPU.
Модель занимает слишком много памяти
Выберите меньший тег, сократите контекст и остановите другие модели. По умолчанию модель некоторое время остаётся в памяти; ollama stop <model> освобождает её раньше.
Open WebUI не видит Ollama
Проверьте адрес из среды самого WebUI. В контейнере localhost:11434 часто указывает не на хост с Ollama. Используйте общую сеть и имя сервиса.
Порт 11434 занят
Скорее всего уже работает приложение, systemd service или другой контейнер. Найдите существующий процесс вместо запуска второго Ollama serve.
FAQ
Что такое Ollama простыми словами?
Это программа и локальный сервер, которые скачивают и запускают языковые модели на вашем компьютере, а затем предоставляют чат и API.
Нужна ли Ollama видеокарта?
Нет, небольшие модели могут работать на CPU. GPU обычно заметно ускоряет генерацию, если достаточная часть модели помещается в видеопамять.
Можно ли отключить облачные функции?
Да. Официальная документация описывает параметр disable_ollama_cloud в ~/.ollama/server.json и переменную OLLAMA_NO_CLOUD=1. После изменения сервер нужно перезапустить.
Как увеличить контекст?
Контекст задаётся параметром модели, API или OLLAMA_CONTEXT_LENGTH. Его увеличение требует дополнительной памяти, особенно при параллельных запросах.
Как узнать, какая модель сейчас загружена?
Выполните ollama ps. Команда показывает запущенные модели, размещение CPU/GPU и время до выгрузки.




