ДомЛаб

Ollama: установка, команды и выбор локальной модели

Что такое Ollama, как установить и запустить модель, выбрать вариант для русского языка, подключить Open WebUI, Docker и локальный API.

11 мин чтенияРедакция ДомЛаб
Иллюстрация к статье: Ollama: установка, команды и выбор локальной модели
Содержание статьи30 разделов

Ollama — локальный runtime и сервер для языковых моделей. Он скачивает подготовленные версии моделей из Ollama Library, запускает их одной командой и предоставляет API на локальном порту 11434. Простейший старт после установки выглядит так:

ollama run qwen3:8b

Команда скачает модель, если её ещё нет, загрузит в память и откроет диалог в терминале. Для домашнего сервера Ollama удобна тем, что работает фоном, подключается к Open WebUI, Python, LangChain и другим клиентам.

Ollama: что это и зачем нужна

Ollama AI объединяет несколько задач:

  • скачивание локальных моделей по имени и тегу;
  • запуск на CPU, GPU или в смешанном режиме;
  • CLI-чат без отдельного интерфейса;
  • локальный HTTP API;
  • управление загруженными и установленными моделями;
  • создание собственных вариантов через Modelfile;
  • генерацию embeddings для RAG и поиска.

Ollama нейросетью не является: это среда выполнения. Ответ генерирует конкретная модель — Qwen, Gemma, Llama, DeepSeek или другая. Поэтому запрос «Ollama плохо отвечает по-русски» сначала требует проверить модель, её размер, системный промпт и квантизацию.

Ollama работает на macOS, Windows и Linux. Локальные запросы и ответы не нужно отправлять в облако. При этом современные версии также могут поддерживать облачные модели и внешние функции; для строго локального режима их можно отключить.

Установка Ollama

Скачивайте программу с официального сайта. После установки откройте терминал и проверьте:

ollama --version

Windows

Установщик добавляет приложение и CLI. Сервис запускается в пользовательской сессии, а команды доступны в PowerShell и Windows Terminal. Если команда не найдена сразу после установки, закройте и заново откройте терминал.

macOS

Установите приложение, переместите его в Applications и запустите. На Apple Silicon модели используют объединённую память. Свободный объём меньше номинального, потому что память нужна и macOS.

Linux

Официальная документация предлагает установочный скрипт:

curl -fsSL https://ollama.com/install.sh | sh

Перед выполнением удалённого скрипта разумно открыть URL и проверить источник. После установки Ollama обычно запускается как systemd service. Статус можно проверить так:

systemctl status ollama

Если HomeLab работает в контейнерах, ниже есть отдельный раздел Docker Ollama. Не устанавливайте одновременно несколько экземпляров на один порт, пока не определили, какой из них будет основным.

Как запустить Ollama и первую модель

Откройте Ollama Library, выберите семейство и точный тег. Затем выполните:

ollama run qwen3:8b

В интерактивном чате введите вопрос. Для выхода используйте:

/bye

Если модель уже скачана, повторный запуск не загружает веса из сети. Чтобы только скачать файл без чата:

ollama pull qwen3:8b

Не путайте имя семейства и тег. Команды ollama run qwen3 и ollama run qwen3:8b могут указывать на один вариант сегодня, но тег latest способен измениться. Для воспроизводимого сервера фиксируйте конкретный размер или digest и проверяйте обновления отдельно.

Основные Ollama команды

ЗадачаКоманда
Запустить модельollama run qwen3:8b
Скачать без запускаollama pull qwen3:8b
Показать модели на дискеollama ls
Показать модели в памятиollama ps
Остановить модельollama stop qwen3:8b
Удалить модельollama rm qwen3:8b
Запустить сервер вручнуюollama serve
Создать вариант из Modelfileollama create my-model -f Modelfile

В старых инструкциях и поисковых формулировках встречается ollama list, но актуальная CLI reference использует ollama ls. Всегда сверяйте команды через:

ollama --help

Команда Ollama serve нужна, если сервер не запущен приложением или службой. Не запускайте второй процесс поверх уже занятого порта.

Ollama модели: как выбрать подходящую

Выбор начинается не с рейтинга, а с четырёх ограничений:

  1. Задача. Общий чат, код, рассуждения, анализ изображения или embeddings требуют разных моделей.
  2. Память. Веса, контекст и параллельные запросы должны помещаться в RAM/VRAM.
  3. Язык. Модель нужно отдельно проверить на русских инструкциях и фактах.
  4. Лицензия. У семейств и производных вариантов различаются условия использования.

Практическая стартовая лестница:

Доступная памятьС чего начатьДля чего подходит
8 ГБ1B–4Bбыстрые команды, классификация, простой чат
12 ГБ7B–8B в умеренной квантизациидомашний ассистент, русский текст, базовый код
16 ГБ8B–14Bболее устойчивые ответы и длиннее контекст
24 ГБ14B–32B в зависимости от квантизациисложный код, RAG, рассуждения
48 ГБ+крупные 32B–70B вариантытяжёлые сценарии и несколько пользователей

Это ориентиры, а не гарантия. Размер контекста и конкретная архитектура меняют потребление. Проверить расчёт можно в калькуляторе VRAM.

После запуска выполните:

ollama ps

Поле PROCESSOR показывает, загружена ли модель полностью на GPU, полностью на CPU или разделена между ними. Если часть весов ушла в RAM, скорость может заметно снизиться.

Ollama модели для русского языка

Для русского языка чаще выбирают современные многоязычные instruct-модели. В библиотеке стоит проверить семейства Qwen, Gemma и производные reasoning-модели на основе многоязычных архитектур. Название семейства само по себе не гарантирует качество конкретного тега.

Сделайте небольшой локальный тест:

  • попросите исправить русский текст без изменения смысла;
  • задайте вопрос с неоднозначной формулировкой;
  • проверьте соблюдение JSON-формата;
  • попросите сослаться на фрагмент вашего документа;
  • сравните галлюцинации на фактах, которых нет в промпте;
  • измерьте скорость на одинаковом контексте.

Для домашнего RAG нужна отдельная embedding-модель. В Ollama Library доступны, например, Qwen3 Embedding, EmbeddingGemma и другие специализированные варианты. Генеративную модель не стоит автоматически использовать для векторного поиска только потому, что она хорошо пишет текст.

Подробнее о принципе такого поиска: эмбеддинги и векторные базы.

Где находится Ollama Library

Ollama Library — официальный каталог модельных пакетов. На странице семейства видны доступные теги, размер файла, контекст, тип входных данных и команды запуска.

Перед загрузкой проверьте:

  • полный тег модели;
  • размер скачивания;
  • поддержку tools, vision или embeddings;
  • дату обновления;
  • базовую модель и лицензию;
  • описание конкретного варианта.

Большое число загрузок не доказывает, что модель лучше для вашего русского текста. Популярность часто отражает возраст и упоминания в старых инструкциях.

Ollama WebUI: подключение Open WebUI

У Ollama есть CLI и API, но для браузерных чатов, истории, пользователей и документов удобен отдельный интерфейс. Популярная связка — Ollama Open WebUI.

Схема простая:

браузер → Open WebUI → Ollama API → локальная модель

Если оба сервиса запущены на одном хосте без контейнеров, WebUI обращается к http://localhost:11434. В Docker слово localhost внутри контейнера указывает на сам контейнер, поэтому используют имя сервиса или адрес хоста.

Полная установка и настройка разобрана в материале Open WebUI: локальный интерфейс для нейросетей.

Запросы Ollama WebUI, WebUI Ollama, Ollama Open WebUI и Open WebUI Ollama описывают одну связку, а не четыре разных продукта.

Ollama Docker и Docker Compose

Официальный CPU-контейнер можно запустить так:

docker run -d \
  -v ollama:/root/.ollama \
  -p 127.0.0.1:11434:11434 \
  --name ollama \
  ollama/ollama

Привязка к 127.0.0.1 не публикует API на всех сетевых интерфейсах. Для доступа из другого контейнера используйте общую Docker network и имя ollama.

Минимальный Ollama Docker Compose:

services:
  ollama:
    image: ollama/ollama
    container_name: ollama
    restart: unless-stopped
    volumes:
      - ollama-data:/root/.ollama
    ports:
      - "127.0.0.1:11434:11434"
 
volumes:
  ollama-data:

Для NVIDIA GPU официальный образ требует NVIDIA Container Toolkit и параметр GPU. Для AMD используется отдельный вариант ROCm, а Vulkan включается отдельной настройкой. Не добавляйте устройства вслепую: сначала сверяйте поддержку вашей видеокарты в актуальной документации Ollama.

После запуска контейнера модель можно вызвать так:

docker exec -it ollama ollama run qwen3:8b

Ollama API и порт 11434

По умолчанию локальный сервер слушает 127.0.0.1:11434. Простой запрос к API:

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3:8b",
  "messages": [
    {"role": "user", "content": "Ответь одним предложением: что такое NAS?"}
  ],
  "stream": false
}'

Ollama port не следует открывать напрямую в интернет: локальный API рассчитан на доверенное окружение и сам по себе не заменяет полноценный шлюз авторизации. Для домашней сети ограничьте firewall, используйте reverse proxy с аутентификацией или VPN.

Чтобы слушать другой интерфейс, задают OLLAMA_HOST. На Linux для systemd переменную добавляют через override службы, на Windows — через пользовательские переменные среды с перезапуском приложения.

Python Ollama, LangChain и n8n

Для Python существует официальный клиентский пакет, а HTTP API можно вызывать любой библиотекой. LangChain Ollama используют как локальный LLM-компонент или источник embeddings. В n8n Ollama подключают к AI-узлам для автоматизаций.

Перед интеграцией проверьте три вещи:

  • клиент видит сервер по правильному адресу;
  • модель уже скачана;
  • таймаут достаточен для первого холодного запуска.

Не передавайте внешнему workflow доступ ко всему локальному API без авторизации. Особенно опасны сценарии, где ответ модели автоматически запускает команды или изменяет данные.

Ollama create и Modelfile

Modelfile позволяет задать базовую модель, системный промпт и параметры. Пример:

FROM qwen3:8b
PARAMETER temperature 0.3
SYSTEM Ты локальный помощник по домашней инфраструктуре. Если не уверен, скажи об этом.

Создание варианта:

ollama create domlab-assistant -f Modelfile
ollama run domlab-assistant

Это не дообучение весов. Ollama create собирает повторяемую конфигурацию поверх базовой модели. Храните Modelfile в репозитории, чтобы настройки можно было воспроизвести.

Где хранятся модели Ollama

Официальная документация указывает стандартные пути:

  • macOS: ~/.ollama/models;
  • Linux: /usr/share/ollama/.ollama/models;
  • Windows: C:\Users\%username%\.ollama\models.

Чтобы перенести хранилище, задайте OLLAMA_MODELS. На Linux пользователь службы ollama должен иметь права чтения и записи в новую папку. Не переносите отдельные blob-файлы вручную во время работы сервиса — остановите его и переносите каталог целиком.

Как удалить модель или Ollama

Чтобы удалить модель Ollama и освободить место:

ollama rm qwen3:8b

Сначала выполните ollama ls и скопируйте точное имя. Запрос «как удалить модель Ollama» не следует путать с полным удалением приложения.

Как удалить Ollama целиком, зависит от операционной системы и способа установки. Остановите сервис, удалите приложение штатным способом и только затем решайте, нужен ли каталог моделей. Веса могут занимать сотни гигабайт и не всегда удаляются вместе с программой.

Ollama vs LM Studio

Ollama vs LM Studio — выбор интерфейса и способа эксплуатации:

  • LM Studio удобнее для визуального поиска GGUF и ручных экспериментов;
  • Ollama удобнее как фоновый сервис, API и backend для WebUI;
  • LM Studio показывает отдельные квантизованные файлы;
  • Ollama упаковывает модель и параметры в собственные теги;
  • обе системы могут использовать близкие локальные runtime и похожие модели.

Если вы не уверены, установите обе и сравните одну модель на одинаковом промпте. Подробная инструкция: LM Studio — установка и первый запуск.

Частые проблемы

Ollama работает только на CPU

Выполните ollama ps во время генерации. Проверьте совместимость GPU, драйвер и контейнерный runtime. Если модель не помещается целиком, возможно смешанное размещение CPU/GPU.

Модель занимает слишком много памяти

Выберите меньший тег, сократите контекст и остановите другие модели. По умолчанию модель некоторое время остаётся в памяти; ollama stop <model> освобождает её раньше.

Open WebUI не видит Ollama

Проверьте адрес из среды самого WebUI. В контейнере localhost:11434 часто указывает не на хост с Ollama. Используйте общую сеть и имя сервиса.

Порт 11434 занят

Скорее всего уже работает приложение, systemd service или другой контейнер. Найдите существующий процесс вместо запуска второго Ollama serve.

FAQ

Что такое Ollama простыми словами?

Это программа и локальный сервер, которые скачивают и запускают языковые модели на вашем компьютере, а затем предоставляют чат и API.

Нужна ли Ollama видеокарта?

Нет, небольшие модели могут работать на CPU. GPU обычно заметно ускоряет генерацию, если достаточная часть модели помещается в видеопамять.

Можно ли отключить облачные функции?

Да. Официальная документация описывает параметр disable_ollama_cloud в ~/.ollama/server.json и переменную OLLAMA_NO_CLOUD=1. После изменения сервер нужно перезапустить.

Как увеличить контекст?

Контекст задаётся параметром модели, API или OLLAMA_CONTEXT_LENGTH. Его увеличение требует дополнительной памяти, особенно при параллельных запросах.

Как узнать, какая модель сейчас загружена?

Выполните ollama ps. Команда показывает запущенные модели, размещение CPU/GPU и время до выгрузки.

Полезные ссылки

Читайте также