Модели

Llama нейросеть: что это, версии, лицензия

Схематичное изображение нейронной сети Llama, иллюстрирующее её структуру и взаимодействие компонентов.

Коротко

Llama — это семейство больших языковых моделей с открытыми весами от Meta, используемых для ответов на вопросы, написания кода и суммирования документов. Существуют версии Llama 3 и Llama 4 со смесью экспертов, например, Llama 4 Scout с 10 миллионами токенов контекста. Модели распространяются по лицензии Llama Community License, которая разрешает коммерческое использование, но требует отдельной лицензии для компаний с аудиторией более 700 миллионов пользователей. Официальной поддержки русского языка нет, но модель может на нём отвечать. Llama можно скачать и запустить локально, но флагманские версии требуют мощного оборудования.

Содержание
  1. Что такое Llama и кто её сделал?
  2. Какие версии Llama есть и чем они отличаются?
  3. Что на самом деле разрешает лицензия Llama?
  4. Понимает ли Llama русский язык?
  5. Можно ли скачать Llama и запустить локально?
  6. Где применяют Llama?
  7. Почему с апреля 2025 года новых открытых весов не было
  8. Чем заменить Llama, если нужен чат на русском?
  9. Коротко о главном
  10. Источники

Что такое Llama и кто её сделал?

Llama — это семейство больших языковых моделей с открытыми весами, которые выпускает компания Meta. В русских текстах её часто называют просто «лама». Работает она с текстом: отвечает на вопросы, пишет и разбирает код, суммирует документы, держит диалог как чат-бот. Meta Platforms признана в России экстремистской организацией, её деятельность запрещена.

Отличие от ChatGPT или Gemini не в качестве ответов, а в способе распространения. Файлы весов лежат в открытом доступе, и любой разработчик может скачать модель, поставить её на свой сервер и не платить за каждый запрос. Именно поэтому Llama стала фундаментом для тысяч сторонних сервисов и дообученных версий.

Первая работа команды вышла 27 февраля 2023 года: статья «LLaMA: Open and Efficient Foundation Language Models» на arXiv описывала линейку от 7 до 65 миллиардов параметров. Авторы заявили две вещи, которые тогда звучали дерзко: модель на 13 миллиардов параметров обходит GPT-3 на 175 миллиардов на большинстве бенчмарков, а обучена она исключительно на публично доступных данных.

Оба тезиса и задали дальнейшую логику проекта. Меньшая модель, обученная лучше, догоняет гиганта, а значит, гонку можно вести не только размером кластера. Это и сделало Llama точкой отсчёта для всей волны открытых языковых моделей, которая пошла следом.

Какие версии Llama есть и чем они отличаются?

Линейка моделей Llama разных размеров от компактных до флагманских

Актуальных поколений два: Llama 3 с классической архитектурой и Llama 4 со смесью экспертов. Разница между ними принципиальная, и она объясняет странные на вид цифры в названиях.

МодельПараметрыКонтекстОсобенность
Llama 3.3 70B70 млрд128 тыс. токеновплотная модель, знания до декабря 2023
Llama 4 Scout17 млрд активных из 109 млрд10 млн токенов16 экспертов, влезает на одну H100
Llama 4 Maverick17 млрд активных из 400 млрд128 экспертов, нужна нода из восьми H100
Llama 4 Behemoth288 млрд активных из ~2 трлнанонсирована, веса не публиковались

Смесь экспертов работает так: в модели лежит много специализированных блоков, но на каждый токен включается лишь малая часть из них. По данным анонса «The Llama 4 herd» в блоге Meta AI от 5 апреля 2025 года, Scout при 109 миллиардах параметров всего активирует только 17 миллиардов на токен и помещается на один ускоритель H100 при квантовании в int4. Контекстное окно в 10 миллионов токенов у Scout на момент выхода было рекордным среди открытых моделей.

Llama 4 ещё и мультимодальна с рождения: текст и картинки сводятся в общий поток на этапе обучения, а не приклеиваются отдельным модулем. Что вообще означает размер контекстного окна и почему за него идёт такая борьба, разобрано в материале про контекстное окно.

Что на самом деле разрешает лицензия Llama?

Лицензия у Llama своя, и open source в строгом смысле она не является. Это ключевой момент, который в русских обзорах обычно теряется за словом «бесплатная».

Модели раздаются по документу Llama Community License. Он разрешает и исследования, и коммерческое использование, но с оговорками. По условиям, приведённым в карточке модели Llama 4 Scout на Hugging Face, компания с аудиторией больше 700 миллионов активных пользователей в месяц обязана запрашивать отдельную лицензию у Meta. А любой продукт на базе модели должен на видном месте показывать надпись «Built with Llama».

Порог в 700 миллионов выглядит запретительным только на первый взгляд. Он написан не про вас, а про конкурентов уровня крупных технологических платформ: лицензия открыта для всех, кроме тех немногих, кому Meta не хочет отдавать модель даром. Для обычной команды ограничение сводится к строчке атрибуции в интерфейсе.

Практический вывод такой. «Открытые веса» означают, что файлы можно скачать и запустить у себя. Они не означают ни свободной лицензии в понимании OSI, ни открытого обучающего набора: данные, на которых модель училась, Meta не публикует.

Понимает ли Llama русский язык?

Русского нет в списке официально поддерживаемых языков ни у одной версии Llama. Это факт, который стоит проверить самому, потому что множество русскоязычных страниц обещают ровно обратное.

В карточке Llama 3.3 70B на Hugging Face заявлены восемь языков: английский, немецкий, французский, итальянский, португальский, хинди, испанский и тайский. У Llama 4 Scout список шире и включает двенадцать позиций, среди них арабский, индонезийский, тагальский и вьетнамский. Русского нет ни там, ни там.

На практике это не значит, что модель по-русски не отвечает. В обучающих данных русский текст неизбежно был, и Llama на нём говорит. Но отсутствие языка в официальном списке означает отсутствие гарантий: качество не измерялось, регрессии между версиями не отслеживаются, а Meta прямо просит соблюдать свою политику при дообучении под неподдерживаемые языки.

Отсюда честный ответ на вопрос «стоит ли брать Llama ради русского». Если русский язык критичен, разумнее взять модель, у которой он в списке заявленных, или дообученную русскоязычную версию от стороннего разработчика. Ставить флагманскую Llama ради русского текста — решение из разряда «можно, но незачем».

Можно ли скачать Llama и запустить локально?

Локальный запуск языковой модели Llama на домашнем компьютере

Скачать можно, но не с одного клика: официальные карточки на Hugging Face закрыты и требуют одобренной заявки. В служебных данных обеих карточек, и Llama 3.3, и Llama 4 Scout, стоит режим ручной выдачи доступа. Вы заполняете форму, принимаете лицензию и ждёте решения. Это первое, обо что спотыкается человек, пришедший по запросу «llama нейросеть скачать».

Обходной путь легален и общеизвестен: сообщество выкладывает те же веса в квантованных форматах отдельными карточками, и они уже открыты. Именно эти сборки обычно и запускают дома через Ollama или похожие оболочки, потому что весят в разы меньше оригинала.

Дальше начинается арифметика железа. Флагманы домой не помещаются: Scout влезает на одну H100 только после сжатия до int4, а Maverick требует целую ноду из восьми таких ускорителей. На обычном компьютере запускают младшие модели линейки 3.2 на 1 и 3 миллиарда параметров или квантованные версии на 7–8 миллиардов, и это уже совсем другой уровень ответов.

Как устроен домашний запуск на практике, какие оболочки для этого есть и сколько нужно оперативной памяти, разобрано в отдельных материалах: про Ollama и локальные языковые модели и общий обзор локальных нейросетей.

Где применяют Llama?

Применяют её там, где важнее контроль над данными, чем максимальное качество ответа. Открытые веса дают то, чего не даёт ни один облачный сервис: запросы не уходят наружу.

Отсюда типовые сценарии. Внутренние чат-боты компаний, где переписка не должна покидать контур. Помощники для написания и разбора кода на своём сервере. Обработка документов, которые нельзя отправлять в чужое облако. Дообучение под узкую предметную область, когда общая модель не знает вашей специфики.

Второй большой класс применений — фундамент для чужих продуктов. Множество сервисов, которые продаются как самостоятельные нейросети, внутри крутят дообученную Llama. Лицензия это разрешает, требуя лишь атрибуции, и именно поэтому счётчики скачиваний остаются высокими: за последние тридцать дней карточка Llama 4 Scout собрала больше 500 тысяч загрузок, а Llama 3.3 70B — больше 420 тысяч.

Почему с апреля 2025 года новых открытых весов не было

Открытые веса языковых моделей и календарь релизов

Последние открытые веса Llama Meta опубликовала в апреле 2025 года, и с тех пор в её официальной организации на Hugging Face новых моделей семейства не появлялось. Проверяется это за минуту: карточки сортируются по дате создания, и свежее апреля 2025-го там только вспомогательные модели безопасности.

Что важно понимать про эту паузу. Анонсированная тогда же Behemoth на 288 миллиардов активных параметров была заявлена как ещё обучающаяся, и её веса так и не вышли. То есть верхняя строчка таблицы моделей больше года стоит пустой, а самой мощной доступной Llama остаётся Maverick из апрельского релиза.

Для читателя вывод практический. Llama остаётся рабочим инструментом, но перестала быть передним краем: за прошедшее время открытые модели других команд ушли вперёд по свежести. Выбирая Llama сегодня, вы выбираете зрелую и хорошо обкатанную базу с огромной экосистемой дообученных версий, а не самую новую модель на рынке.

Чем заменить Llama, если нужен чат на русском?

Проще взять модель, у которой русский заявлен официально, и не заниматься инфраструктурой. Скажем прямо: Llama в каталоге Trackly нет, и доступ к ней мы не продаём.

Мы закрываем соседнюю задачу — даём в одном окне модели, которые уверенно работают с русским текстом, без VPN и за рубли. В каталоге доступны Claude Sonnet 4.6, GPT-5, Gemini 2.5 Pro и другие текстовые модели. Переписка идёт в обычном чате, платить можно российской картой, а расход считается с единого баланса.

После регистрации с подтверждением почты на баланс приходит приветственный бонус — его хватает, чтобы сравнить пару моделей на своих же задачах и понять, какая отвечает лучше. Что выбрать под конкретную работу, видно в каталоге нейросетей, а развёрнутое сравнение флагманов есть в разборе ChatGPT, Claude и Gemini.

Коротко о главном

Llama — это семейство открытых языковых моделей Meta, от компактных версий на пару миллиардов параметров до Maverick с 400 миллиардами в смеси экспертов. Веса скачиваются свободно, но с оговорками: официальные карточки закрыты заявкой, лицензия не свободная в строгом смысле, русского нет в списке поддерживаемых языков, а новых открытых релизов не было с апреля 2025 года. Для своей инфраструктуры и приватных данных это по-прежнему сильный выбор. Для повседневного чата на русском проще открыть готовый сервис.

Источники

Поделиться: TelegramVKWhatsApp

Частые вопросы

Что такое Llama нейросеть?+

Llama — это семейство больших языковых моделей с открытыми весами, разработанных компанией Meta. Она умеет отвечать на вопросы, писать и разбирать код, суммировать документы и вести диалог. Отличие Llama от других моделей — в открытом доступе к файлам весов, что позволяет разработчикам скачивать и запускать её на своих серверах без оплаты за каждый запрос.

Какие версии Llama существуют?+

Актуальных поколений Llama два: Llama 3 с классической архитектурой и Llama 4 со смесью экспертов. Среди них есть Llama 3.3 70B с 70 миллиардами параметров и Llama 4 Scout, которая активирует 17 миллиардов параметров из 109 миллиардов и имеет контекстное окно в 10 миллионов токенов. Также анонсирована Llama 4 Behemoth, но её веса не публиковались.

Понимает ли Llama русский язык?+

Русского нет в списке официально поддерживаемых языков ни у одной версии Llama. Например, Llama 3.3 70B поддерживает восемь языков, а Llama 4 Scout — двенадцать, но русский среди них отсутствует. На практике модель может отвечать по-русски, так как русский текст неизбежно присутствовал в обучающих данных, но качество не гарантируется.

Можно ли скачать Llama и запустить дома?+

Да, Llama можно скачать и запустить локально. Официальные карточки на Hugging Face требуют одобренной заявки, но сообщество выкладывает те же веса в квантованных форматах, которые доступны без ограничений. Запускать флагманские модели дома сложно из-за требований к железу, но младшие версии или квантованные сборки на 7–8 миллиардов параметров вполне подходят для обычного компьютера.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly