Сравнения

Локальная нейросеть: 4 способа запуска

Схема, показывающая, что четыре способа запуска локальной нейросети различаются порогом входа, а не возможностями.

Коротко

Локальная нейросеть работает на вашем железе, обеспечивая приватность данных и отсутствие лимитов. Существует четыре основных способа запуска: Ollama, LM Studio, llama.cpp и AI Edge Gallery для мобильных устройств. Выбор зависит от порога входа и требуемого контроля. Для определения подходящей модели необходимо учитывать объём видеопамяти, требуемый весами, контекстом и KV-кэшем.

Содержание
  1. Что такое локальная нейросеть и чем она отличается от облака?
  2. Чем запустить модель на своём компьютере: сравнение четырёх способов
  3. Кому подойдёт Ollama?
  4. Чем LM Studio удобнее командной строки?
  5. Зачем нужен llama.cpp, если есть готовые оболочки
  6. Можно ли запустить локальную нейросеть на телефоне?
  7. Как посчитать, влезет ли модель в вашу видеокарту?
  8. Что локальная модель делает хуже облачной?
  9. Локально или в облаке: как выбрать под задачу
  10. Источники

Что такое локальная нейросеть и чем она отличается от облака?

Локальная нейросеть — это модель, которая работает на вашем железе, а не на чужом сервере. Файл с весами лежит на диске, вычисления идут на вашем процессоре или видеокарте, запрос не покидает компьютер. Ни аккаунта, ни счётчика запросов.

Разница с облачным сервисом сводится к трём вещам. Данные остаются у вас. Лимитов нет — модель отвечает столько раз, сколько выдержит железо. И платите вы не за запросы, а за электричество и за видеокарту, которая уже куплена.

Плата за это тоже конкретная. Открытые модели, влезающие в домашнюю машину, слабее облачных флагманов, отвечают медленнее и требуют вечера на настройку. Дальше разберём четыре способа запустить модель у себя и посчитаем, какая из них поместится в вашу видеокарту.

Чем запустить модель на своём компьютере: сравнение четырёх способов

Способы отличаются не возможностями, а тем, сколько усилий нужно до первого ответа. Внизу списка — приложение, которое ставится как любое другое; вверху — движок, который придётся собирать самому.

ИнструментПорог входаЖелезоЧто умеет
Ollamaодна команда в терминалеWindows, macOS, Linux; видеокарта желательнатекстовые модели, локальный API, интеграции с редакторами
LM Studioобычное приложение с кнопкамиmacOS 14+ на Apple Silicon, Windows x64 и ARM, Ubuntu 20.04+чат, ответы по своим документам, локальный сервер
llama.cppсборка из исходников или готовый бинарникпочти любое, от ноутбука до одноплатникасам движок инференса, максимум контроля
AI Edge Galleryприложение из магазинаAndroid 12+, iOS 17+чат, вопросы по картинке, расшифровка речи

Ollama и LM Studio закрывают девять случаев из десяти. llama.cpp нужен тем, кто хочет управлять каждым флагом. Мобильное приложение — отдельная история, и о нём ниже.

Кому подойдёт Ollama?

Четыре способа запустить модель локально различаются порогом входа, а не возможностями

Ollama подойдёт тем, кто не боится терминала и хочет, чтобы модель была доступна другим программам. Это менеджер моделей плюс локальный сервер: скачивает веса, держит их в порядке и поднимает REST API на порту 11434.

Репозиторий Ollama на GitHub написан на Go, открыт по лицензии MIT и собрал около 178 тысяч звёзд. Свежий релиз v0.32.6 вышел 4 августа 2026 года. Вычисляет за него llama.cpp, о чём прямо сказано в разделе Supported backends: Ollama берёт на себя удобство, а не математику.

Установка занимает одну строку, запуск модели — команду ollama run с именем. Дальше поверх ставится веб-оболочка, и терминал больше не нужен. Подробный разбор с командами и требованиями к драйверам у нас в гайде по Ollama.

Слабое место — первое знакомство. Пока не выучите пять команд, всё происходит в чёрном окне без подсказок.

Чем LM Studio удобнее командной строки?

LM Studio выигрывает тем, что это обычное приложение: поиск моделей, кнопка «скачать», окно чата. Терминал не нужен ни на одном шаге.

Внутри встроен загрузчик, который тянет модели напрямую с Hugging Face. По документации о загрузке моделей у одной модели там несколько вариантов с именами вроде Q3_K_S или Q_8 — это степени сжатия, и разработчики советуют брать 4-битный вариант или выше, если машина тянет. Поддерживаются форматы GGUF и MLX, второй — родной для чипов Apple.

А вот требования жёстче, чем кажется. Официальная страница системных требований называет минимум 8 ГБ оперативной памяти при рекомендованных 16 ГБ и выше, а для процессоров x64 обязательна поддержка инструкций AVX2. Отдельный пункт для владельцев старых маков: нужна macOS 14.0 или новее на чипах Apple Silicon, компьютеры на Intel не поддерживаются вовсе.

Ещё LM Studio умеет отвечать по вашим документам и поднимать локальный сервер в формате OpenAI. То есть та же роль, что у Ollama, только без командной строки.

Зачем нужен llama.cpp, если есть готовые оболочки

llama.cpp нужен там, где готовая оболочка мешает. Это сам движок инференса на C и C++, тот самый, который крутится внутри Ollama и LM Studio.

Цифры из репозитория llama.cpp объясняют его положение: лицензия MIT, около 123 тысяч звёзд, первый коммит в марте 2023 года. Релизы выходят номерами сборок почти ежедневно, свежая на 7 августа 2026 года — b10298 от 6 августа. Такой темп означает, что новые модели появляются здесь раньше, чем в надстройках.

В README перечислены две вещи, ради которых к нему и лезут. Первая — квантизация от 1,5 до 8 бит: можно ужать модель настолько, чтобы она влезла в конкретную карту. Вторая — гибридный режим CPU и GPU, который позволяет частично ускорять модели крупнее, чем весь объём видеопамяти.

Запуск устроен так же просто, как у оболочек: команда llama cli -hf с именем репозитория качает модель прямо с Hugging Face, а llama serve поднимает сервер с OpenAI-совместимым API. Сложность начинается дальше, в десятках флагов.

Можно ли запустить локальную нейросеть на телефоне?

Модели среднего размера легко забивают видеопамять целиком

Можно, и для этого есть официальное приложение от Google. AI Edge Gallery на GitHub открыт по лицензии Apache 2.0, собрал около 24 тысяч звёзд, версия 1.0.17 вышла 3 августа 2026 года.

Требования из README короткие: Android 12 и выше или iOS 17 и выше. Модели скачиваются с Hugging Face прямо в приложение, выполняются рантаймом LiteRT и работают целиком на устройстве. В README это сформулировано прямо: инференс идёт на железе телефона, интернет не требуется.

Что там есть кроме чата: вопросы по фотографии с камеры, расшифровка и перевод голосовых записей, площадка для проверки промптов с настройкой температуры. Есть и бенчмарк, который меряет скорость конкретной модели на вашем телефоне.

Размеры под мобильные модели отдельные. В документации Gemma есть колонка Mobile: версия E2B укладывается примерно в 1,1 ГБ, E4B — в 2,5 ГБ. Это уже реально для телефона, но и уровень ответов соответствующий.

Как посчитать, влезет ли модель в вашу видеокарту?

Считается это в три слагаемых, и топовые подборки локальных нейросетей обычно ограничиваются советом «нужна хорошая видеокарта». Конкретика выглядит так.

Первое слагаемое — веса. Документация Gemma даёт готовые цифры для 4-битной квантизации Q4_0: E2B требует около 2,9 ГБ, E4B — 4,5 ГБ, модель на 12 миллиардов параметров — 6,7 ГБ, на 31 миллиард — 17,5 ГБ. Google отдельно оговаривает, что в оценку уже заложен запас 20%, но контекстное окно в неё не входит.

Второе слагаемое — как раз контекст. По документации Ollama о длине контекста движок по умолчанию берёт 4k токенов при видеопамяти меньше 24 ГиБ, 32k при 24–48 ГиБ и 256k при 48 ГиБ и выше. Для работы с кодом и агентами там же рекомендуют минимум 64 000 токенов, и эта память идёт сверх весов.

Третье слагаемое — KV-кэш, и его можно ужать. В FAQ Ollama сказано, что режим q8_0 занимает примерно половину памяти от стандартного f16 и обычно не сказывается на качестве ответов, а q4_0 укладывается в четверть с заметной просадкой на длинном контексте.

Проверка после запуска занимает секунду. Команда ollama ps выводит колонку PROCESSOR: «100% GPU» означает, что модель целиком в видеопамяти, «48%/52% CPU/GPU» — что половина уехала в оперативную память и скорость упала. Ориентир на практике: 8 ГБ видеопамяти комфортно держат модели до 8–12 миллиардов параметров, 16 ГБ дают запас на длинный контекст.

Что локальная модель делает хуже облачной?

Локальный запуск и облако выигрывают в разном: приватность против качества моделей

Хуже она делает четыре вещи, и это стоит знать до покупки видеокарты.

Качество на сложных задачах. Модель, влезающая в домашнюю карту, уступает облачным флагманам на длинных рассуждениях и коде. Русский текст проседает сильнее английского: по нашим наблюдениям, средние по размеру открытые модели путают падежи и скатываются в кальки.

Скорость на слабом железе. Как только часть слоёв уезжает в оперативную память, ответ идёт по несколько токенов в секунду.

Модальности. Локальные текстовые движки не генерируют видео и не дают реалистичной озвучки. Картинки рисует отдельный стек, про него у нас есть разбор запуска Stable Diffusion локально.

Время. Установка, подбор модели и настройка контекста съедают вечер, а обновления моделей приходится отслеживать вручную.

Локально или в облаке: как выбрать под задачу

Выбор упирается в характер работы, а не в принципы.

Локальный запуск берут, когда данные нельзя выпускать наружу, когда объём запросов большой и однотипный и когда связь ненадёжна. Три условия работают вместе: при постоянной нагрузке видеокарта окупается, при разовых задачах она простаивает.

Облако берут, когда нужно лучшее качество прямо сейчас, когда задача разовая и когда видеокарты просто нет. Отдельный случай — работа с картинками, видео и озвучкой: локально это либо тяжело, либо невозможно.

У нас все модели собраны в одном окне: каталог нейросетей с оплатой в рублях и без VPN. Один запрос в чате стоит 20 токенов, а приветственный бонус даёт попробовать бесплатно. Смежные материалы: подробный гайд по Ollama и что работает без интернета.

Источники

  • Ollama, репозиторий на GitHub — лицензия MIT, релиз v0.32.6, движок llama.cpp; проверено 2026-08-07
  • Ollama, Context length — контекст по умолчанию в зависимости от видеопамяти; проверено 2026-08-07
  • Ollama, FAQ — квантизация KV-кэша, колонка PROCESSOR в ollama ps; проверено 2026-08-07
  • LM Studio, System Requirements — минимум памяти, AVX2, поддерживаемые версии ОС; проверено 2026-08-07
  • LM Studio, Download an LLM — загрузка с Hugging Face, выбор квантизации; проверено 2026-08-07
  • llama.cpp, репозиторий на GitHub — лицензия MIT, сборка b10298, квантизация 1,5–8 бит, гибридный режим CPU и GPU; проверено 2026-08-07
  • Google AI Edge Gallery на GitHub — лицензия Apache 2.0, версия 1.0.17, требования Android 12+ и iOS 17+; проверено 2026-08-07
  • Gemma, документация Google — таблица требований к памяти, включая мобильную колонку; проверено 2026-08-07
Поделиться: TelegramVKWhatsApp

Частые вопросы

Что такое локальная нейросеть?+

Локальная нейросеть — это модель, которая работает на вашем компьютере, используя его процессор или видеокарту. Все вычисления происходят на устройстве, данные не покидают его, и нет лимитов на количество запросов. Вы платите только за электричество и уже купленную видеокарту.

Какие есть способы запустить локальную нейросеть?+

Существует четыре основных способа запустить локальную нейросеть: Ollama, LM Studio, llama.cpp и AI Edge Gallery. Ollama и LM Studio — это приложения, которые проще в установке. llama.cpp — движок инференса для максимального контроля, а AI Edge Gallery — мобильное приложение для Android и iOS.

Как посчитать, влезет ли модель в видеокарту?+

Чтобы посчитать, влезет ли модель в видеокарту, нужно сложить три слагаемых: объём весов модели, память для контекста и KV-кэш. Например, 4-битная модель на 12 миллиардов параметров требует около 6,7 ГБ. 8 ГБ видеопамяти комфортно держат модели до 8–12 миллиардов параметров, а 16 ГБ дают запас на длинный контекст.

Чем локальная нейросеть отличается от облачной?+

Локальная нейросеть обеспечивает приватность данных и отсутствие лимитов, но может уступать облачным флагманам в качестве на сложных задачах, скорости на слабом железе и поддержке модальностей, таких как генерация видео. Облако выбирают для лучшего качества и разовых задач, а локальный запуск — для конфиденциальных данных и большого объёма однотипных запросов.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly