Что такое токены в нейросети: объясняем

Коротко
Токен — это кусок текста, которым языковая модель оперирует вместо букв и слов. Он влияет на стоимость работы модели, длину текста, который она способна обработать, и скорость ответа. Токенизатор разбивает текст по словарю, собранному статистически, и у каждой модели свой словарь. Русский текст сегодня дороже английского примерно на 10%.
Содержание
- Что такое токен и чем он отличается от слова?
- Как нейросеть разбивает текст на токены?
- Правда ли, что кириллица дороже латиницы?
- Почему у разных моделей число токенов разное?
- Что входит в лимит токенов одного запроса?
- Чем токены на балансе Trackly отличаются от токенов модели?
- Как посчитать токены заранее
- Как сократить расход токенов
- Источники
Что такое токен и чем он отличается от слова?
Токен — это кусок текста, с которым языковая модель работает вместо отдельной буквы и вместо целого слова. Длина куска плавает: у частых слов токен совпадает со словом целиком, у редких слово рассыпается на две-три части, а незнакомый набор символов может уйти в модель посимвольно. Границы токенов задаёт словарь, собранный один раз до обучения, и поменять его на лету нельзя.
Модель вообще не работает с буквами. У каждого токена из словаря есть номер, номер превращается в вектор — длинный список чисел. В нейросеть попадают уже эти числа. Поэтому вопросы вроде «сколько букв „р“ в слове „программирование“» модель решает плохо: букв она не видит, ей достался склеенный кусок.
Документация Gemini API даёт грубый ориентир: в разделе «Understand and count tokens» сказано, что один токен — это примерно 4 символа, а 100 токенов соответствуют 60–80 английским словам. Ориентир рабочий для английского. Для русского он врёт.
Зачем эта единица нужна вам как пользователю? Токены меряют сразу три вещи: счёт за работу модели по API, длину текста, который модель способна удержать за раз, и скорость ответа. Разберётесь с ними — поймёте, за что платите и почему длинный документ иногда не влезает.
Как нейросеть разбивает текст на токены?
Текст разбивает отдельная программа — токенизатор, и работает она по словарю, собранному по статистике. Алгоритм смотрит на корпус текстов, находит самую частую пару соседних символов, склеивает её в один элемент и повторяет процедуру тысячи раз. Частые сочетания дорастают до целых слов, редкие остаются обрывками.
Метод называется byte pair encoding, и в машинный перевод его принесли Рико Сеннрих, Барри Хэддоу и Александра Бёрч. В работе «Neural Machine Translation of Rare Words with Subword Units» на arXiv в 2015 году они показали, что разбиение редких слов на подслова снимает проблему открытого словаря: качество перевода выросло на 1,1 BLEU для английского с немецким и на 1,3 BLEU для английского с русским. Приём прижился, и сегодня на нём работают токенизаторы почти всех больших моделей.

Посмотреть на результат можно вживую. Библиотека tiktoken от OpenAI отдаёт для модели gpt-4o кодировку o200k_base, и мы прогнали через неё несколько слов:
| Что подали на вход | Токенов | На какие куски распалось |
|---|---|---|
| Здравствуйте | 1 | «Здравствуйте» |
| привет | 2 | «пр», «ивет» |
| токен | 3 | «т», «ок», «ен» |
| нейросеть | 3 | «ней», «рос», «еть» |
| контекстное окно | 4 | «конт», «екст», «ное», « окно» |
| neural | 2 | «ne», «ural» |
Логика видна невооружённым глазом. «Здравствуйте» в обучающем корпусе встречалось так часто, что заслужило отдельный номер целиком, а «нейросеть» — слово молодое, ему достались три обрывка. Пробел, кстати, обычно приклеивается к следующему слову: в паре «контекстное окно» последний токен идёт вместе с ведущим пробелом.
Правда ли, что кириллица дороже латиницы?
Правда, но разрыв за последние годы схлопнулся почти до нуля. Ходовое утверждение «русский текст стоит в два-три раза дороже английского» было верным для токенизаторов позапрошлого поколения, а на актуальных моделях разница измеряется процентами. Мы проверили это на одном и том же абзаце: взяли текст про контекстное окно на русском и его перевод на английский, после чего посчитали токены двумя кодировками tiktoken.
| Токенизатор | Для каких моделей | Токенов на русский абзац | Токенов на английский | Символов на токен, русский |
|---|---|---|---|---|
| cl100k_base | gpt-4, gpt-3.5-turbo | 132 | 68 | 2,42 |
| o200k_base | gpt-4o и новее | 77 | 68 | 4,16 |
Русский абзац из 320 символов на старой кодировке занял 132 токена, на новой — 77. Отношение к английскому упало с 1,94 до 1,13. Английский абзац в обоих случаях дал одинаковые 68 токенов: его разбиение не менялось. А вот кириллице расширенный словарь помог радикально: плотность выросла с 2,42 символа на токен до 4,16. У английского она равна 5,13.
Практический смысл простой: если вам попадалась статья или ролик двухлетней давности, где русский называют вдвое дороже, эта информация устарела вместе с моделью, на которой её измеряли. Наценка за кириллицу сегодня около десяти процентов, а не сто.
Есть оговорка. Прибавку всё равно даёт транслитерация, эмодзи, редкие термины и код с русскими комментариями: такие фрагменты рассыпаются на мелкие куски у любого токенизатора. Проверять расход на своём реальном тексте всё ещё полезнее, чем верить общей формуле.
Почему у разных моделей число токенов разное?
Потому что у каждого семейства моделей свой словарь и свой токенизатор. Одна и та же фраза даёт разное число токенов у OpenAI, Google и Anthropic, и напрямую сравнивать цены за миллион токенов между провайдерами поэтому некорректно.

Мы проверили тот же абзац через официальный метод countTokens в Gemini API. Модель gemini-2.5-flash насчитала 81 токен на русском варианте и 68 на английском — отношение 1,19, то есть почти та же картина, что у o200k_base. Разброс между современными токенизаторами держится в пределах нескольких процентов, поэтому для прикидки годится любой из них.
Токены к тому же бывают разного сорта, и считают их отдельно. Входные — всё, что вы отправили. Выходные — то, что модель написала в ответ. У рассуждающих моделей добавляются токены размышления: документация Anthropic прямо указывает, что они тарифицируются как выходные и учитываются в лимите окна наравне с остальным. Кэшированные части запроса тоже занимают окно, кэш меняет только цену.
Что входит в лимит токенов одного запроса?
В лимит входит весь запрос целиком, а не только ваше сообщение. Документация Anthropic перечисляет состав прямо: системная подсказка, каждое сообщение переписки, результаты вызванных инструментов, изображения, документы и описания самих инструментов. Ответ модели тоже занимает место в этом же окне.
Размер окна у ходовых моделей 2026 года различается на порядок. GPT-5 по спецификации OpenAI держит контекст в 400 000 токенов и выдаёт до 128 000 токенов ответа. У Claude Opus 4.7 и Claude Sonnet 4.6 окно достигает миллиона токенов, у Claude Haiku 4.5 — 200 тысяч. Что происходит при переполнении и как жить с длинными диалогами, разобрано в статье про контекстное окно нейросети.
Переполнение обрабатывается жёстко: если один только ввод превышает окно, API возвращает ошибку 400 с сообщением «prompt is too long». Никакого автоматического «модель прочитает главное» не происходит, поэтому книгу целиком в один запрос не отправить. Про потолки бесплатных тарифов и лимиты чатов написано в разборе лимитов ChatGPT.
Чем токены на балансе Trackly отличаются от токенов модели?
Это две разные единицы, и путать их не стоит. Токены модели — техническая единица текста, о которой шла речь выше. Токены на балансе Trackly — внутренняя валюта сервиса: ими оплачивается запуск инструмента, и курс к рублю фиксирован тарифом.
Разница видна на цене. Один ответ в чате с нейросетью стоит 20 токенов независимо от того, сколько технических токенов модель потратила на ответ: тариф текстового чата фиксированный, а не по факту расхода. Длинный ответ и короткий списывают одинаково. У картинок логика та же: генерация в Nano Banana стоит 55 токенов за изображение, где токены модели вообще ни при чём.
Поэтому на балансе сервиса имеет смысл считать запуски, а не символы: сколько ответов, картинок и роликов вы получите за пакет. Раскладку по тарифам и текущую цену токена смотрите на странице тарифов — там же видно, что купленные токены не сгорают.
Токены модели остаются важны для тех, кто идёт в API напрямую: там счёт идёт за миллион входных и выходных токенов, и экономия на длине запроса ощутима. Для работы через интерфейс достаточно помнить про лимит окна.
Как посчитать токены заранее
Точный счёт даёт только официальный токенизатор модели; оценка «символы делить на четыре» годится лишь для прикидки. У провайдеров для этого есть готовые инструменты, и все три работают без запуска самой генерации.
- Gemini — метод
countTokens, описанный в документации: он возвращает число токенов только по входу и ничего не стоит. - OpenAI — библиотека tiktoken:
tiktoken.encoding_for_model("gpt-4o")вернёт нужную кодировку, аlen(enc.encode(текст))— число токенов. - Claude — отдельный API подсчёта токенов, о котором говорит документация контекстных окон.
После запроса точную цифру можно взять из ответа: провайдеры возвращают поле usage с разбивкой на вход, выход, размышления и кэш. Это надёжнее любой прикидки, потому что учитывает служебные добавки.
Как сократить расход токенов
Расход режут три приёма, и на длинных задачах эффект от них заметен.
Не тащите в запрос лишнее: полный текст договора ради одного пункта отправлять не нужно, вырежьте раздел. Начинайте новый диалог, когда тема сменилась, — старая переписка уезжает в запрос целиком и с каждым ходом дорожает. Просите короткий ответ явно: выходные токены у большинства моделей стоят в разы дороже входных.
Ещё один рычаг — выбор модели под задачу. Пересказать письмо и написать код на сотню строк — разные по сложности задачи, и держать на первой самую дорогую модель незачем. Как устроены модели внутри и почему длина запроса вообще влияет на счёт, мы разобрали в статье как работают нейросети.
Источники
- Google — «Understand and count tokens», документация Gemini API (проверено 2026-08-07).
- Sennrich R., Haddow B., Birch A. — «Neural Machine Translation of Rare Words with Subword Units», arXiv, 2015 (проверено 2026-08-07).
- OpenAI — tiktoken, репозиторий токенизатора (проверено 2026-08-07).
- OpenAI — спецификация модели GPT-5 (проверено 2026-08-07).
- Anthropic — документация «Контекстные окна» (проверено 2026-08-07).
Частые вопросы
Что такое токен в нейросети простыми словами+
Токен — это единица текста, которой оперирует языковая модель. Он может быть целым словом, частью слова или даже одним символом. Модель не работает с буквами, а каждому токену присваивается номер, который затем превращается в числовой вектор.
Как нейросеть разбивает текст на токены+
Текст разбивает специальная программа — токенизатор, которая работает по словарю. Этот словарь формируется заранее, находя самые частые сочетания символов и склеивая их. Метод называется byte pair encoding и позволяет эффективно обрабатывать слова, в том числе редкие.
Кириллица дороже латиницы в нейросетях+
Да, кириллица дороже латиницы, но разрыв сократился. Если раньше русский текст мог быть в два-три раза дороже, то на актуальных моделях разница составляет около 10%. Например, для gpt-4o русский текст на 320 символов занял 77 токенов, а его английский перевод — 68 токенов.
Почему у разных моделей разное число токенов+
У каждой модели свой словарь и свой токенизатор, поэтому одна и та же фраза может давать разное число токенов у разных провайдеров. Например, OpenAI, Google и Anthropic используют свои алгоритмы. Это делает прямое сравнение цен за миллион токенов между провайдерами некорректным.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly