Локальная нейросеть: 4 способа запуска

Коротко
Локальная нейросеть работает на вашем железе, обеспечивая приватность данных и отсутствие лимитов. Существует четыре основных способа запуска: Ollama, LM Studio, llama.cpp и AI Edge Gallery для мобильных устройств. Выбор зависит от порога входа и требуемого контроля. Для определения подходящей модели необходимо учитывать объём видеопамяти, требуемый весами, контекстом и KV-кэшем.
Содержание
- Что такое локальная нейросеть и чем она отличается от облака?
- Чем запустить модель на своём компьютере: сравнение четырёх способов
- Кому подойдёт Ollama?
- Чем LM Studio удобнее командной строки?
- Зачем нужен llama.cpp, если есть готовые оболочки
- Можно ли запустить локальную нейросеть на телефоне?
- Как посчитать, влезет ли модель в вашу видеокарту?
- Что локальная модель делает хуже облачной?
- Локально или в облаке: как выбрать под задачу
- Источники
Что такое локальная нейросеть и чем она отличается от облака?
Локальная нейросеть — это модель, которая работает на вашем железе, а не на чужом сервере. Файл с весами лежит на диске, вычисления идут на вашем процессоре или видеокарте, запрос не покидает компьютер. Ни аккаунта, ни счётчика запросов.
Разница с облачным сервисом сводится к трём вещам. Данные остаются у вас. Лимитов нет — модель отвечает столько раз, сколько выдержит железо. И платите вы не за запросы, а за электричество и за видеокарту, которая уже куплена.
Плата за это тоже конкретная. Открытые модели, влезающие в домашнюю машину, слабее облачных флагманов, отвечают медленнее и требуют вечера на настройку. Дальше разберём четыре способа запустить модель у себя и посчитаем, какая из них поместится в вашу видеокарту.
Чем запустить модель на своём компьютере: сравнение четырёх способов
Способы отличаются не возможностями, а тем, сколько усилий нужно до первого ответа. Внизу списка — приложение, которое ставится как любое другое; вверху — движок, который придётся собирать самому.
| Инструмент | Порог входа | Железо | Что умеет |
|---|---|---|---|
| Ollama | одна команда в терминале | Windows, macOS, Linux; видеокарта желательна | текстовые модели, локальный API, интеграции с редакторами |
| LM Studio | обычное приложение с кнопками | macOS 14+ на Apple Silicon, Windows x64 и ARM, Ubuntu 20.04+ | чат, ответы по своим документам, локальный сервер |
| llama.cpp | сборка из исходников или готовый бинарник | почти любое, от ноутбука до одноплатника | сам движок инференса, максимум контроля |
| AI Edge Gallery | приложение из магазина | Android 12+, iOS 17+ | чат, вопросы по картинке, расшифровка речи |
Ollama и LM Studio закрывают девять случаев из десяти. llama.cpp нужен тем, кто хочет управлять каждым флагом. Мобильное приложение — отдельная история, и о нём ниже.
Кому подойдёт Ollama?

Ollama подойдёт тем, кто не боится терминала и хочет, чтобы модель была доступна другим программам. Это менеджер моделей плюс локальный сервер: скачивает веса, держит их в порядке и поднимает REST API на порту 11434.
Репозиторий Ollama на GitHub написан на Go, открыт по лицензии MIT и собрал около 178 тысяч звёзд. Свежий релиз v0.32.6 вышел 4 августа 2026 года. Вычисляет за него llama.cpp, о чём прямо сказано в разделе Supported backends: Ollama берёт на себя удобство, а не математику.
Установка занимает одну строку, запуск модели — команду ollama run с именем. Дальше поверх ставится веб-оболочка, и терминал больше не нужен. Подробный разбор с командами и требованиями к драйверам у нас в гайде по Ollama.
Слабое место — первое знакомство. Пока не выучите пять команд, всё происходит в чёрном окне без подсказок.
Чем LM Studio удобнее командной строки?
LM Studio выигрывает тем, что это обычное приложение: поиск моделей, кнопка «скачать», окно чата. Терминал не нужен ни на одном шаге.
Внутри встроен загрузчик, который тянет модели напрямую с Hugging Face. По документации о загрузке моделей у одной модели там несколько вариантов с именами вроде Q3_K_S или Q_8 — это степени сжатия, и разработчики советуют брать 4-битный вариант или выше, если машина тянет. Поддерживаются форматы GGUF и MLX, второй — родной для чипов Apple.
А вот требования жёстче, чем кажется. Официальная страница системных требований называет минимум 8 ГБ оперативной памяти при рекомендованных 16 ГБ и выше, а для процессоров x64 обязательна поддержка инструкций AVX2. Отдельный пункт для владельцев старых маков: нужна macOS 14.0 или новее на чипах Apple Silicon, компьютеры на Intel не поддерживаются вовсе.
Ещё LM Studio умеет отвечать по вашим документам и поднимать локальный сервер в формате OpenAI. То есть та же роль, что у Ollama, только без командной строки.
Зачем нужен llama.cpp, если есть готовые оболочки
llama.cpp нужен там, где готовая оболочка мешает. Это сам движок инференса на C и C++, тот самый, который крутится внутри Ollama и LM Studio.
Цифры из репозитория llama.cpp объясняют его положение: лицензия MIT, около 123 тысяч звёзд, первый коммит в марте 2023 года. Релизы выходят номерами сборок почти ежедневно, свежая на 7 августа 2026 года — b10298 от 6 августа. Такой темп означает, что новые модели появляются здесь раньше, чем в надстройках.
В README перечислены две вещи, ради которых к нему и лезут. Первая — квантизация от 1,5 до 8 бит: можно ужать модель настолько, чтобы она влезла в конкретную карту. Вторая — гибридный режим CPU и GPU, который позволяет частично ускорять модели крупнее, чем весь объём видеопамяти.
Запуск устроен так же просто, как у оболочек: команда llama cli -hf с именем репозитория качает модель прямо с Hugging Face, а llama serve поднимает сервер с OpenAI-совместимым API. Сложность начинается дальше, в десятках флагов.
Можно ли запустить локальную нейросеть на телефоне?

Можно, и для этого есть официальное приложение от Google. AI Edge Gallery на GitHub открыт по лицензии Apache 2.0, собрал около 24 тысяч звёзд, версия 1.0.17 вышла 3 августа 2026 года.
Требования из README короткие: Android 12 и выше или iOS 17 и выше. Модели скачиваются с Hugging Face прямо в приложение, выполняются рантаймом LiteRT и работают целиком на устройстве. В README это сформулировано прямо: инференс идёт на железе телефона, интернет не требуется.
Что там есть кроме чата: вопросы по фотографии с камеры, расшифровка и перевод голосовых записей, площадка для проверки промптов с настройкой температуры. Есть и бенчмарк, который меряет скорость конкретной модели на вашем телефоне.
Размеры под мобильные модели отдельные. В документации Gemma есть колонка Mobile: версия E2B укладывается примерно в 1,1 ГБ, E4B — в 2,5 ГБ. Это уже реально для телефона, но и уровень ответов соответствующий.
Как посчитать, влезет ли модель в вашу видеокарту?
Считается это в три слагаемых, и топовые подборки локальных нейросетей обычно ограничиваются советом «нужна хорошая видеокарта». Конкретика выглядит так.
Первое слагаемое — веса. Документация Gemma даёт готовые цифры для 4-битной квантизации Q4_0: E2B требует около 2,9 ГБ, E4B — 4,5 ГБ, модель на 12 миллиардов параметров — 6,7 ГБ, на 31 миллиард — 17,5 ГБ. Google отдельно оговаривает, что в оценку уже заложен запас 20%, но контекстное окно в неё не входит.
Второе слагаемое — как раз контекст. По документации Ollama о длине контекста движок по умолчанию берёт 4k токенов при видеопамяти меньше 24 ГиБ, 32k при 24–48 ГиБ и 256k при 48 ГиБ и выше. Для работы с кодом и агентами там же рекомендуют минимум 64 000 токенов, и эта память идёт сверх весов.
Третье слагаемое — KV-кэш, и его можно ужать. В FAQ Ollama сказано, что режим q8_0 занимает примерно половину памяти от стандартного f16 и обычно не сказывается на качестве ответов, а q4_0 укладывается в четверть с заметной просадкой на длинном контексте.
Проверка после запуска занимает секунду. Команда ollama ps выводит колонку PROCESSOR: «100% GPU» означает, что модель целиком в видеопамяти, «48%/52% CPU/GPU» — что половина уехала в оперативную память и скорость упала. Ориентир на практике: 8 ГБ видеопамяти комфортно держат модели до 8–12 миллиардов параметров, 16 ГБ дают запас на длинный контекст.
Что локальная модель делает хуже облачной?

Хуже она делает четыре вещи, и это стоит знать до покупки видеокарты.
Качество на сложных задачах. Модель, влезающая в домашнюю карту, уступает облачным флагманам на длинных рассуждениях и коде. Русский текст проседает сильнее английского: по нашим наблюдениям, средние по размеру открытые модели путают падежи и скатываются в кальки.
Скорость на слабом железе. Как только часть слоёв уезжает в оперативную память, ответ идёт по несколько токенов в секунду.
Модальности. Локальные текстовые движки не генерируют видео и не дают реалистичной озвучки. Картинки рисует отдельный стек, про него у нас есть разбор запуска Stable Diffusion локально.
Время. Установка, подбор модели и настройка контекста съедают вечер, а обновления моделей приходится отслеживать вручную.
Локально или в облаке: как выбрать под задачу
Выбор упирается в характер работы, а не в принципы.
Локальный запуск берут, когда данные нельзя выпускать наружу, когда объём запросов большой и однотипный и когда связь ненадёжна. Три условия работают вместе: при постоянной нагрузке видеокарта окупается, при разовых задачах она простаивает.
Облако берут, когда нужно лучшее качество прямо сейчас, когда задача разовая и когда видеокарты просто нет. Отдельный случай — работа с картинками, видео и озвучкой: локально это либо тяжело, либо невозможно.
У нас все модели собраны в одном окне: каталог нейросетей с оплатой в рублях и без VPN. Один запрос в чате стоит 20 токенов, а приветственный бонус даёт попробовать бесплатно. Смежные материалы: подробный гайд по Ollama и что работает без интернета.
Источники
- Ollama, репозиторий на GitHub — лицензия MIT, релиз v0.32.6, движок llama.cpp; проверено 2026-08-07
- Ollama, Context length — контекст по умолчанию в зависимости от видеопамяти; проверено 2026-08-07
- Ollama, FAQ — квантизация KV-кэша, колонка PROCESSOR в
ollama ps; проверено 2026-08-07 - LM Studio, System Requirements — минимум памяти, AVX2, поддерживаемые версии ОС; проверено 2026-08-07
- LM Studio, Download an LLM — загрузка с Hugging Face, выбор квантизации; проверено 2026-08-07
- llama.cpp, репозиторий на GitHub — лицензия MIT, сборка b10298, квантизация 1,5–8 бит, гибридный режим CPU и GPU; проверено 2026-08-07
- Google AI Edge Gallery на GitHub — лицензия Apache 2.0, версия 1.0.17, требования Android 12+ и iOS 17+; проверено 2026-08-07
- Gemma, документация Google — таблица требований к памяти, включая мобильную колонку; проверено 2026-08-07
Частые вопросы
Что такое локальная нейросеть?+
Локальная нейросеть — это модель, которая работает на вашем компьютере, используя его процессор или видеокарту. Все вычисления происходят на устройстве, данные не покидают его, и нет лимитов на количество запросов. Вы платите только за электричество и уже купленную видеокарту.
Какие есть способы запустить локальную нейросеть?+
Существует четыре основных способа запустить локальную нейросеть: Ollama, LM Studio, llama.cpp и AI Edge Gallery. Ollama и LM Studio — это приложения, которые проще в установке. llama.cpp — движок инференса для максимального контроля, а AI Edge Gallery — мобильное приложение для Android и iOS.
Как посчитать, влезет ли модель в видеокарту?+
Чтобы посчитать, влезет ли модель в видеокарту, нужно сложить три слагаемых: объём весов модели, память для контекста и KV-кэш. Например, 4-битная модель на 12 миллиардов параметров требует около 6,7 ГБ. 8 ГБ видеопамяти комфортно держат модели до 8–12 миллиардов параметров, а 16 ГБ дают запас на длинный контекст.
Чем локальная нейросеть отличается от облачной?+
Локальная нейросеть обеспечивает приватность данных и отсутствие лимитов, но может уступать облачным флагманам в качестве на сложных задачах, скорости на слабом железе и поддержке модальностей, таких как генерация видео. Облако выбирают для лучшего качества и разовых задач, а локальный запуск — для конфиденциальных данных и большого объёма однотипных запросов.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly