Гайды

Что такое токены в нейросети: объясняем

Фраза на русском языке разложена на токены разного цвета, где одни слова представлены целиком, а другие разбиты на части.

Коротко

Токен — это кусок текста, которым языковая модель оперирует вместо букв и слов. Он влияет на стоимость работы модели, длину текста, который она способна обработать, и скорость ответа. Токенизатор разбивает текст по словарю, собранному статистически, и у каждой модели свой словарь. Русский текст сегодня дороже английского примерно на 10%.

Содержание
  1. Что такое токен и чем он отличается от слова?
  2. Как нейросеть разбивает текст на токены?
  3. Правда ли, что кириллица дороже латиницы?
  4. Почему у разных моделей число токенов разное?
  5. Что входит в лимит токенов одного запроса?
  6. Чем токены на балансе Trackly отличаются от токенов модели?
  7. Как посчитать токены заранее
  8. Как сократить расход токенов
  9. Источники

Что такое токен и чем он отличается от слова?

Токен — это кусок текста, с которым языковая модель работает вместо отдельной буквы и вместо целого слова. Длина куска плавает: у частых слов токен совпадает со словом целиком, у редких слово рассыпается на две-три части, а незнакомый набор символов может уйти в модель посимвольно. Границы токенов задаёт словарь, собранный один раз до обучения, и поменять его на лету нельзя.

Модель вообще не работает с буквами. У каждого токена из словаря есть номер, номер превращается в вектор — длинный список чисел. В нейросеть попадают уже эти числа. Поэтому вопросы вроде «сколько букв „р“ в слове „программирование“» модель решает плохо: букв она не видит, ей достался склеенный кусок.

Документация Gemini API даёт грубый ориентир: в разделе «Understand and count tokens» сказано, что один токен — это примерно 4 символа, а 100 токенов соответствуют 60–80 английским словам. Ориентир рабочий для английского. Для русского он врёт.

Зачем эта единица нужна вам как пользователю? Токены меряют сразу три вещи: счёт за работу модели по API, длину текста, который модель способна удержать за раз, и скорость ответа. Разберётесь с ними — поймёте, за что платите и почему длинный документ иногда не влезает.

Как нейросеть разбивает текст на токены?

Текст разбивает отдельная программа — токенизатор, и работает она по словарю, собранному по статистике. Алгоритм смотрит на корпус текстов, находит самую частую пару соседних символов, склеивает её в один элемент и повторяет процедуру тысячи раз. Частые сочетания дорастают до целых слов, редкие остаются обрывками.

Метод называется byte pair encoding, и в машинный перевод его принесли Рико Сеннрих, Барри Хэддоу и Александра Бёрч. В работе «Neural Machine Translation of Rare Words with Subword Units» на arXiv в 2015 году они показали, что разбиение редких слов на подслова снимает проблему открытого словаря: качество перевода выросло на 1,1 BLEU для английского с немецким и на 1,3 BLEU для английского с русским. Приём прижился, и сегодня на нём работают токенизаторы почти всех больших моделей.

Фраза на русском разложена на токены разного цвета: одни слова целиком, другие разбиты на части

Посмотреть на результат можно вживую. Библиотека tiktoken от OpenAI отдаёт для модели gpt-4o кодировку o200k_base, и мы прогнали через неё несколько слов:

Что подали на входТокеновНа какие куски распалось
Здравствуйте1«Здравствуйте»
привет2«пр», «ивет»
токен3«т», «ок», «ен»
нейросеть3«ней», «рос», «еть»
контекстное окно4«конт», «екст», «ное», « окно»
neural2«ne», «ural»

Логика видна невооружённым глазом. «Здравствуйте» в обучающем корпусе встречалось так часто, что заслужило отдельный номер целиком, а «нейросеть» — слово молодое, ему достались три обрывка. Пробел, кстати, обычно приклеивается к следующему слову: в паре «контекстное окно» последний токен идёт вместе с ведущим пробелом.

Правда ли, что кириллица дороже латиницы?

Правда, но разрыв за последние годы схлопнулся почти до нуля. Ходовое утверждение «русский текст стоит в два-три раза дороже английского» было верным для токенизаторов позапрошлого поколения, а на актуальных моделях разница измеряется процентами. Мы проверили это на одном и том же абзаце: взяли текст про контекстное окно на русском и его перевод на английский, после чего посчитали токены двумя кодировками tiktoken.

ТокенизаторДля каких моделейТокенов на русский абзацТокенов на английскийСимволов на токен, русский
cl100k_basegpt-4, gpt-3.5-turbo132682,42
o200k_basegpt-4o и новее77684,16

Русский абзац из 320 символов на старой кодировке занял 132 токена, на новой — 77. Отношение к английскому упало с 1,94 до 1,13. Английский абзац в обоих случаях дал одинаковые 68 токенов: его разбиение не менялось. А вот кириллице расширенный словарь помог радикально: плотность выросла с 2,42 символа на токен до 4,16. У английского она равна 5,13.

Практический смысл простой: если вам попадалась статья или ролик двухлетней давности, где русский называют вдвое дороже, эта информация устарела вместе с моделью, на которой её измеряли. Наценка за кириллицу сегодня около десяти процентов, а не сто.

Есть оговорка. Прибавку всё равно даёт транслитерация, эмодзи, редкие термины и код с русскими комментариями: такие фрагменты рассыпаются на мелкие куски у любого токенизатора. Проверять расход на своём реальном тексте всё ещё полезнее, чем верить общей формуле.

Почему у разных моделей число токенов разное?

Потому что у каждого семейства моделей свой словарь и свой токенизатор. Одна и та же фраза даёт разное число токенов у OpenAI, Google и Anthropic, и напрямую сравнивать цены за миллион токенов между провайдерами поэтому некорректно.

Одна фраза, посчитанная тремя разными токенизаторами, даёт три разных числа токенов

Мы проверили тот же абзац через официальный метод countTokens в Gemini API. Модель gemini-2.5-flash насчитала 81 токен на русском варианте и 68 на английском — отношение 1,19, то есть почти та же картина, что у o200k_base. Разброс между современными токенизаторами держится в пределах нескольких процентов, поэтому для прикидки годится любой из них.

Токены к тому же бывают разного сорта, и считают их отдельно. Входные — всё, что вы отправили. Выходные — то, что модель написала в ответ. У рассуждающих моделей добавляются токены размышления: документация Anthropic прямо указывает, что они тарифицируются как выходные и учитываются в лимите окна наравне с остальным. Кэшированные части запроса тоже занимают окно, кэш меняет только цену.

Что входит в лимит токенов одного запроса?

В лимит входит весь запрос целиком, а не только ваше сообщение. Документация Anthropic перечисляет состав прямо: системная подсказка, каждое сообщение переписки, результаты вызванных инструментов, изображения, документы и описания самих инструментов. Ответ модели тоже занимает место в этом же окне.

Размер окна у ходовых моделей 2026 года различается на порядок. GPT-5 по спецификации OpenAI держит контекст в 400 000 токенов и выдаёт до 128 000 токенов ответа. У Claude Opus 4.7 и Claude Sonnet 4.6 окно достигает миллиона токенов, у Claude Haiku 4.5 — 200 тысяч. Что происходит при переполнении и как жить с длинными диалогами, разобрано в статье про контекстное окно нейросети.

Переполнение обрабатывается жёстко: если один только ввод превышает окно, API возвращает ошибку 400 с сообщением «prompt is too long». Никакого автоматического «модель прочитает главное» не происходит, поэтому книгу целиком в один запрос не отправить. Про потолки бесплатных тарифов и лимиты чатов написано в разборе лимитов ChatGPT.

Чем токены на балансе Trackly отличаются от токенов модели?

Это две разные единицы, и путать их не стоит. Токены модели — техническая единица текста, о которой шла речь выше. Токены на балансе Trackly — внутренняя валюта сервиса: ими оплачивается запуск инструмента, и курс к рублю фиксирован тарифом.

Разница видна на цене. Один ответ в чате с нейросетью стоит 20 токенов независимо от того, сколько технических токенов модель потратила на ответ: тариф текстового чата фиксированный, а не по факту расхода. Длинный ответ и короткий списывают одинаково. У картинок логика та же: генерация в Nano Banana стоит 55 токенов за изображение, где токены модели вообще ни при чём.

Поэтому на балансе сервиса имеет смысл считать запуски, а не символы: сколько ответов, картинок и роликов вы получите за пакет. Раскладку по тарифам и текущую цену токена смотрите на странице тарифов — там же видно, что купленные токены не сгорают.

Токены модели остаются важны для тех, кто идёт в API напрямую: там счёт идёт за миллион входных и выходных токенов, и экономия на длине запроса ощутима. Для работы через интерфейс достаточно помнить про лимит окна.

Как посчитать токены заранее

Точный счёт даёт только официальный токенизатор модели; оценка «символы делить на четыре» годится лишь для прикидки. У провайдеров для этого есть готовые инструменты, и все три работают без запуска самой генерации.

  • Gemini — метод countTokens, описанный в документации: он возвращает число токенов только по входу и ничего не стоит.
  • OpenAI — библиотека tiktoken: tiktoken.encoding_for_model("gpt-4o") вернёт нужную кодировку, а len(enc.encode(текст)) — число токенов.
  • Claude — отдельный API подсчёта токенов, о котором говорит документация контекстных окон.

После запроса точную цифру можно взять из ответа: провайдеры возвращают поле usage с разбивкой на вход, выход, размышления и кэш. Это надёжнее любой прикидки, потому что учитывает служебные добавки.

Как сократить расход токенов

Расход режут три приёма, и на длинных задачах эффект от них заметен.

Не тащите в запрос лишнее: полный текст договора ради одного пункта отправлять не нужно, вырежьте раздел. Начинайте новый диалог, когда тема сменилась, — старая переписка уезжает в запрос целиком и с каждым ходом дорожает. Просите короткий ответ явно: выходные токены у большинства моделей стоят в разы дороже входных.

Ещё один рычаг — выбор модели под задачу. Пересказать письмо и написать код на сотню строк — разные по сложности задачи, и держать на первой самую дорогую модель незачем. Как устроены модели внутри и почему длина запроса вообще влияет на счёт, мы разобрали в статье как работают нейросети.

Источники

Поделиться: TelegramVKWhatsApp

Частые вопросы

Что такое токен в нейросети простыми словами+

Токен — это единица текста, которой оперирует языковая модель. Он может быть целым словом, частью слова или даже одним символом. Модель не работает с буквами, а каждому токену присваивается номер, который затем превращается в числовой вектор.

Как нейросеть разбивает текст на токены+

Текст разбивает специальная программа — токенизатор, которая работает по словарю. Этот словарь формируется заранее, находя самые частые сочетания символов и склеивая их. Метод называется byte pair encoding и позволяет эффективно обрабатывать слова, в том числе редкие.

Кириллица дороже латиницы в нейросетях+

Да, кириллица дороже латиницы, но разрыв сократился. Если раньше русский текст мог быть в два-три раза дороже, то на актуальных моделях разница составляет около 10%. Например, для gpt-4o русский текст на 320 символов занял 77 токенов, а его английский перевод — 68 токенов.

Почему у разных моделей разное число токенов+

У каждой модели свой словарь и свой токенизатор, поэтому одна и та же фраза может давать разное число токенов у разных провайдеров. Например, OpenAI, Google и Anthropic используют свои алгоритмы. Это делает прямое сравнение цен за миллион токенов между провайдерами некорректным.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly