Ollama: как запустить нейросеть локально?

Коротко
Ollama — бесплатная программа для запуска больших языковых моделей на вашем компьютере. Она позволяет запускать LLM локально, сохраняя приватность данных и не требуя регистрации или оплаты токенов. Для установки достаточно одной команды, а для работы с моделями требуется соответствующее железо, в первую очередь видеопамять.
Содержание
- Что такое Ollama и зачем она нужна?
- Как установить Ollama на Windows, macOS и Linux?
- Какие модели можно скачать в Ollama?
- Какое железо нужно, чтобы модель не тормозила?
- Куда Ollama качает модели и как не забить системный диск?
- Какие команды Ollama нужны каждый день?
- Как заменить терминал на графический интерфейс?
- Где Ollama упирается в потолок
- Ollama или облачный доступ: что выбрать под задачу
- Источники
Что такое Ollama и зачем она нужна?
Ollama — это бесплатная программа для запуска больших языковых моделей на своём компьютере. Вы её ставите, пишете одну команду в терминале, и модель отвечает локально. Веса лежат на вашем диске, запросы никуда не уходят.
Проект написан на Go и открыт по лицензии MIT. В 2026 году у репозитория Ollama на GitHub около 178 тысяч звёзд, первый коммит датирован июнём 2023 года, а свежий релиз v0.32.6 вышел 4 августа 2026 года. Раздел Supported backends в README называет единственный вычислительный движок под капотом — llama.cpp.
Значит, сама Ollama ничего не считает. Она оборачивает чужой инференс и забирает себе рутину: скачивает веса, раскладывает их по своему каталогу, поднимает локальный сервер с REST API на порту 11434 и даёт командную строку для чата. Плюс официальные библиотеки для Python и JavaScript, чтобы дёргать модель прямо из кода приложения.
Ради чего терпеть терминал. Локальная нейросеть не спрашивает регистрации, не считает токены и не отправляет текст на чужой сервер. Для работы с внутренними документами, кодом из закрытого репозитория или в дороге без связи это решающий довод.
Как установить Ollama на Windows, macOS и Linux?
Установка занимает одну строку и почти не зависит от операционной системы. По разделу Download в README проекта команды такие:
- macOS и Linux:
curl -fsSL https://ollama.com/install.sh | sh - Windows:
irm https://ollama.com/install.ps1 | iexв PowerShell - Docker: официальный образ
ollama/ollamaс Docker Hub
Для macOS и Windows есть обычные установщики, если открывать командную строку не хочется: dmg и exe качаются с сайта проекта. После установки Ollama работает фоновой службой и поднимается сама при старте системы.
Дальше всё происходит в терминале. Команда ollama без аргументов запускает интерактивный помощник — он предложит выбрать модель или подключить Ollama к уже установленным инструментам. Первый запуск конкретной модели выглядит как ollama run gemma4: файлы скачаются автоматически, потом появится приглашение чата.
Локальный сервер после установки слушает адрес http://localhost:11434. По документации о совместимости с OpenAI у Ollama есть слой, повторяющий формат запросов OpenAI. Приложение, которое умеет ходить в OpenAI, обычно переключается на локальную модель сменой адреса и имени модели. Это и делает Ollama удобной подложкой под чужие интерфейсы.
Какие модели можно скачать в Ollama?

Ollama тянет открытые модели из своей библиотеки: семейства Gemma от Google, Llama от Meta, Qwen от Alibaba, DeepSeek и десятки других. Команда ollama pull имя скачивает веса, ollama run имя сразу открывает чат. В каталоге у каждой модели перечислены доступные размеры, и выбирать придётся именно размер.
Официальная документация Gemma на ai.google.dev переводит размеры в гигабайты. В 2026 году при 4-битной квантизации Q4_0 версия E2B требует около 2,9 ГБ памяти, E4B — 4,5 ГБ, вариант на 12 миллиардов параметров — 6,7 ГБ, а самый крупный на 31 миллиард уже 17,5 ГБ. Google оговаривает, что оценка покрывает только веса с запасом 20% и не включает контекстное окно.
Что из этого следует. Модель на 2–4 миллиарда параметров влезает в любой современный ноутбук и отвечает бодро, но заметно теряется на длинных рассуждениях. От 12 миллиардов нужна дискретная видеокарта. Флагманы уровня 70 миллиардов в FAQ проекта приводятся как пример загрузки на 42 ГБ, и это уже не домашний компьютер.
Есть подвох в самом слове «модель». В документации о облачных моделях описан отдельный тип: имена вида gpt-oss:120b-cloud запускаются не у вас, а на серверах Ollama, для них нужен аккаунт и команда ollama signin. Команда та же, интерфейс тот же, но локального в такой модели ничего нет.
Русский язык у открытых моделей — отдельная история. По нашим наблюдениям, средние по размеру модели говорят по-русски заметно хуже, чем по-английски: путают падежи, скатываются в кальки с английского. Разница с облачными флагманами видна на первом же абзаце.
Какое железо нужно, чтобы модель не тормозила?

Главный ресурс — видеопамять. Модель, которая целиком влезла в VRAM, отвечает быстро. Если не влезла, часть слоёв уезжает в оперативную память, и скорость падает в разы.
Ollama показывает это честно. Команда ollama ps выводит колонку PROCESSOR, и по FAQ проекта значение «100% GPU» означает полную загрузку в видеопамять, «100% CPU» — работу на процессоре, а «48%/52% CPU/GPU» — тот самый гибридный режим, который и тормозит. Одной командой видно, куда именно уехала модель.
Требования к самим картам собраны в разделе Hardware support. Nvidia поддерживается начиная с compute capability 5.0 и драйвера версии 550, а для карт с capability от 5.0 до 6.2 нужен драйвер 570 и новее. AMD Radeon работает через ROCm v7, и список совместимых карт там заметно короче.
Есть неочевидная статья расхода — контекстное окно. По документации о длине контекста движок ставит по умолчанию 4k токенов при видеопамяти меньше 24 ГиБ, 32k при 24–48 ГиБ и 256k при 48 ГиБ и выше. Для агентов, поиска и работы с кодом там же рекомендуют минимум 64 000 токенов, а это память сверх весов модели.
Отсюда бытовой ориентир. 8 ГБ оперативной памяти и встроенная графика — только самые мелкие модели и много терпения. 8 ГБ видеопамяти — спокойная работа с моделями до 8–12 миллиардов параметров. 24 ГБ и выше — размер, при котором локальный запуск начинает конкурировать с облаком по качеству.
Куда Ollama качает модели и как не забить системный диск?
Модели уезжают на системный диск, и по умолчанию их никто не спрашивает. FAQ проекта называет точные пути: ~/.ollama/models на macOS, /usr/share/ollama/.ollama/models на Linux и C:\Users\%username%\.ollama\models на Windows. Три модели среднего размера — и системный раздел на 256 ГБ ощутимо худеет.
Каталог переносится переменной окружения OLLAMA_MODELS: указываете любую папку, хоть на диске D, хоть на внешнем SSD. Одна оговорка касается Linux: при установке штатным скриптом службе нужен доступ к новой папке, и в FAQ прямо написано выдать его командой sudo chown -R ollama:ollama <директория>. Без этого шага служба молча не увидит модели.
Дальше место контролируется двумя командами. ollama ls показывает всё, что скачано, вместе с размером; ollama rm имя удаляет модель целиком. Отдельного «мусорного бака» нет, файл стирается сразу.
Мелочь, которая экономит гигабайты. Разные квантизации одной модели Ollama хранит как отдельные записи, поэтому после экспериментов «а как оно в 8 битах» на диске легко остаётся три копии одной и той же нейросети. Проверять список стоит хотя бы раз в месяц.
Какие команды Ollama нужны каждый день?
Шесть. CLI-справочник описывает весь набор, но в повседневной работе крутится короткий список.
| Команда | Что делает |
|---|---|
ollama run имя | открывает чат с моделью, при первом вызове скачивает её |
ollama pull имя | только загрузка весов, без запуска |
ollama ls | показывает, что уже лежит на диске |
ollama ps | показывает, что загружено в память прямо сейчас |
ollama rm имя | удаляет модель и освобождает место |
ollama serve | поднимает локальный сервер вручную |
Модель после ответа не выгружается мгновенно. По FAQ она висит в памяти пять минут, чтобы следующий запрос обработался быстрее, а поведение меняется переменной OLLAMA_KEEP_ALIVE или командой ollama stop. На ноутбуке это слышно по вентиляторам.
Ещё одна настройка выручает слабую видеокарту — квантизация KV-кэша. В том же FAQ сказано, что режим q8_0 занимает примерно половину памяти от стандартного f16 и обычно не сказывается на качестве ответов, а q4_0 укладывается в четверть, но просадка становится заметной на длинном контексте.
Как заменить терминал на графический интерфейс?

Терминал нужен только на старте. Дальше поверх Ollama ставится веб-оболочка, и работа выглядит как обычный чат в браузере.
Самый заметный вариант — Open WebUI: около 148 тысяч звёзд на GitHub, версия v0.11.0 от 27 июля 2026 года, история диалогов, загрузка документов, переключение между моделями в одном окне. Оболочка подключается к локальному серверу Ollama и не требует правок в самой Ollama.
Отдельная ветка — интеграции с инструментами разработчика. Команда ollama launch из CLI-справочника настраивает подключение сторонних утилит и редакторов, чтобы они ходили в локальную модель вместо облачной. Список совместимых клиентов в README проекта занимает несколько экранов.
Есть и путь для тех, кому вся эта возня не нужна: чат с нейросетью прямо в браузере открывается без установки и качает ноль гигабайт.
Где Ollama упирается в потолок
Ollama работает ровно до границы, которую ставит железо. За этой границей начинаются четыре ограничения, и лучше знать о них заранее.
Качество. Открытые модели, влезающие в домашнюю видеокарту, отстают от облачных флагманов на сложных задачах. Разрыв заметнее всего на длинных рассуждениях, коде и русском тексте.
Скорость. На процессоре без видеокарты ответ идёт по несколько токенов в секунду, и разница с облаком чувствуется на первой же минуте.
Модальности. Ollama занимается языковыми моделями. Генерации видео и реалистичной озвучки в ней нет, картинки локально рисует совсем другой стек — про него у нас есть разбор запуска Stable Diffusion локально.
Время. Установка, подбор модели, настройка контекста и оболочки съедят вечер минимум, а следить за обновлениями моделей придётся вручную.
Ollama или облачный доступ: что выбрать под задачу
Ответ зависит от характера задачи, а не от принципов. Четыре пункта ниже решают дело в большинстве случаев.
| Критерий | Ollama локально | Облачный доступ |
|---|---|---|
| Стоимость старта | ноль рублей, но нужна видеокарта | ноль рублей, железо не нужно |
| Приватность | данные остаются на компьютере | запрос уходит на сервер |
| Качество моделей | ограничено объёмом памяти | флагманы доступны сразу |
| Время на настройку | вечер и больше | минуты |
Локальный запуск выигрывает там, где данные нельзя выпускать наружу, где нужен объём без лимитов и где интернет ненадёжен. Проигрывает — в качестве моделей, в скорости на слабом железе и в цене входа, если подходящей видеокарты пока нет.
Мы и сами держим часть инструментов на локальных моделях: удаление фона в нашем каталоге работает на модели rembg прямо на нашем сервере. Вывод из этого опыта короткий. Локальный запуск окупается при постоянной однотипной нагрузке, а разовые задачи дешевле закрывать облаком.
Кому возиться не хочется, у нас все модели собраны в одном окне: каталог нейросетей с оплатой в рублях и без VPN. Один запрос в чате стоит 20 токенов, а приветственный бонус даёт попробовать бесплатно. Смежные разборы: способы запустить нейросеть у себя и что реально работает без интернета.
Источники
- Ollama, репозиторий проекта на GitHub — лицензия MIT, язык Go, релиз v0.32.6, движок llama.cpp, команды установки; проверено 2026-08-07
- Ollama, Hardware support — поддерживаемые видеокарты Nvidia и AMD, версии драйверов; проверено 2026-08-07
- Ollama, Context length — значения контекста по объёму видеопамяти; проверено 2026-08-07
- Ollama, FAQ — пути хранения моделей,
OLLAMA_MODELS, выгрузка из памяти, квантизация KV-кэша; проверено 2026-08-07 - Ollama, CLI Reference — список команд; проверено 2026-08-07
- Ollama, Cloud — облачные модели с суффиксом
-cloud; проверено 2026-08-07 - Ollama, OpenAI compatibility — совместимый слой API; проверено 2026-08-07
- Gemma, документация Google — требования к памяти по размерам модели; проверено 2026-08-07
- Open WebUI на GitHub — веб-оболочка для локальных моделей; проверено 2026-08-07
Частые вопросы
Что такое Ollama+
Ollama — это бесплатная программа, написанная на Go, для запуска больших языковых моделей (LLM) на вашем компьютере. Она оборачивает чужой инференс, скачивает веса моделей, поднимает локальный сервер с REST API и предоставляет командную строку для чата. Проект имеет открытый исходный код по лицензии MIT.
Как установить Ollama на Windows, macOS, Linux+
Установка Ollama занимает одну строку в терминале. Для macOS и Linux используется команда `curl -fsSL https://ollama.com/install.sh | sh`, для Windows — `irm https://ollama.com/install.ps1 | iex` в PowerShell. Также доступны обычные установщики для macOS и Windows. После установки Ollama работает как фоновая служба.
Какие модели можно скачать в Ollama+
Ollama поддерживает открытые модели из своей библиотеки, включая семейства Gemma от Google, Llama от Meta, Qwen от Alibaba и DeepSeek. Модели скачиваются командой `ollama pull имя`, а чат с ними запускается командой `ollama run имя`. Важно выбирать размер модели, так как он влияет на требования к памяти.
Какое железо нужно для Ollama+
Главный ресурс для Ollama — видеопамять (VRAM). Модель, полностью поместившаяся в VRAM, отвечает быстро. Если модель не влезает, часть слоёв уходит в оперативную память, что снижает скорость. Для моделей до 8–12 миллиардов параметров достаточно 8 ГБ видеопамяти, а для флагманов требуется 24 ГБ и выше.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly