Гайды

Как работают нейросети: от токенов до галлюц

Схема нейросети, показывающая входной, скрытые и выходной слои, а также связи между нейронами, подписанные весами.

Коротко

Нейросеть учится на примерах, подбирая внутренние настройки. Она состоит из слоев нейронов и весов, обрабатывает текст токенами и использует механизм внимания для связей. Модели могут выдумывать факты, потому что предсказывают правдоподобное продолжение, а не проверяют истину, а также забывают начало разговора, когда он не помещается в контекстное окно.

Содержание
  1. Что такое нейросеть и почему её сравнивают с мозгом?
  2. Как устроена нейросеть: слои, нейроны и веса
  3. Как нейросеть учится на своих ошибках?
  4. Почему модель читает текст не буквами, а токенами?
  5. Как работает внимание — приём, на котором стоят современные модели
  6. Почему нейросеть забывает начало разговора?
  7. Чем отличаются нейросети для текста, картинок и видео?
  8. Почему нейросеть уверенно выдумывает факты?
  9. Где попробовать нейросеть на русском без VPN?
  10. Источники

Что такое нейросеть и почему её сравнивают с мозгом?

Нейросеть — это программа, которая учится на примерах вместо того, чтобы работать по заранее прописанным правилам. Обычный алгоритм разработчик расписывает по шагам: если сумма больше тысячи, поставь галочку. Для нейросети шаги не пишет никто. Ей показывают огромное количество пар «вход — правильный ответ», и она сама подбирает внутренние настройки так, чтобы попадать в этот ответ. Отсюда и название всего раздела — машинное обучение.

Сравнение с мозгом пришло из терминологии. Элементы сети называют нейронами, связи между ними — весами. Да и сам подход в середине прошлого века вырос из попытки описать нервную клетку формулой. Дальше сходство заканчивается. Живой нейрон — сложная химическая машина. Искусственный складывает числа и умножает их на коэффициенты.

Есть аналогия удобнее. Представьте гигантский микшерный пульт: ручек на нём не десяток, а миллиарды. Каждая чуть-чуть меняет то, что получится на выходе. Обучение — это долгое подкручивание ручек: их вращают, пока звук не станет похож на нужный. Когда обучение закончено, ручки замирают: модель не запоминает ваши разговоры и ничего не дописывает в себя по ходу переписки.

На практике это значит вот что: нейросеть не хранит факты списком, как база данных или поисковый индекс. Она хранит числа. Всё, что она «знает», размазано по весам, и достать оттуда точную цитату так же трудно, как вытащить из готового супа отдельную морковку.

Современный чат при этом устроен не так, как описывает большинство разборов «как работают нейросети». Там обычно останавливаются на свёрточных и рекуррентных архитектурах, которым больше десяти лет. Чат, которым вы пользуетесь сегодня, стоит на токенах, внимании и контекстном окне.

Как устроена нейросеть: слои, нейроны и веса

Нейросеть собрана из слоёв: входного, нескольких скрытых и выходного. Данные заходят в первый слой, проходят сквозь скрытые и выходят ответом. Каждый нейрон скрытого слоя берёт числа с предыдущего слоя, умножает каждое на свой вес, складывает результаты и прибавляет смещение. Одно умножение, одно сложение — и так миллиарды раз за один запрос.

В учебном курсе Google по машинному обучению есть показательный расчёт. Раздел «Nodes and hidden layers» разбирает сеть с тремя входами и четырьмя нейронами в единственном скрытом слое: у неё уже 21 настраиваемый параметр — 16 в скрытом слое и 5 на выходе. Умножьте масштаб на миллион — получите порядок величин современных языковых моделей.

Схема нейросети: входной слой, два скрытых слоя и выходной слой, связи между нейронами подписаны весами

Между слоями стоит ещё одна деталь — функция активации. Без неё вся цепочка сложений и умножений схлопывается обратно в одну прямую линию, и лишние слои не дают ничего. Тот же курс предупреждает об этом прямо: сколько ни складывай и ни умножай результаты таких же действий, прямая останется прямой. Активация ломает прямую. Нейрон реагирует на слабый сигнал иначе, чем на сильный, и сеть получает возможность выучить кривые, углы и исключения.

Главное происходит в скрытых слоях. Если сеть работает с картинками, первые слои ловят пятна и границы. Средние собирают из этих границ глаза, колёса и буквы. Последние складывают из этого «кот» или «дорожный знак» — так устроено распознавание образов. Никто не программировал эту иерархию вручную, она сложилась сама во время обучения.

Как нейросеть учится на своих ошибках?

Нейросеть учится методом обратного распространения ошибки. Сеть делает предсказание, сравнивает его с правильным ответом, считает величину промаха и гонит её обратно по слоям — от выхода ко входу. Каждый вес получает свою долю вины и сдвигается в сторону, которая уменьшит ошибку. Дальше берётся следующий пример, и цикл повторяется.

Бытовая аналогия — пристрелка. Первый выстрел уходит вправо и вверх, стрелок вносит поправку, второй ложится ближе. Разница в том, что у нейросети «прицелов» миллиарды и правит она их одновременно, крошечными шагами.

Сбои при обучении типовые. Google в разделе «Backpropagation» называет три. Затухающие градиенты: правки до нижних слоёв доходят почти нулевыми. Взрывающиеся градиенты: веса разлетаются, и обучение не сходится. «Мёртвые» ReLU-нейроны: застревают на нуле и перестают влиять на результат. Лечат всё это так: меняют функцию активации, добавляют нормализацию, снижают шаг обучения.

Оттуда же взят приём против зубрёжки. Dropout-регуляризация на каждом шаге обучения случайно гасит часть нейронов; их долю задают числом от 0,0 до 1,0. Сеть перестаёт полагаться на отдельные удачные связи и вынуждена искать закономерность, а не запоминать примеры наизусть. Проверяют результат честно: часть данных откладывают заранее и показывают модели только после обучения.

Почему модель читает текст не буквами, а токенами?

Языковая модель не видит ни букв, ни слов — она видит токены. Токен — это кусок текста длиной от одного символа до целого слова. Набор таких кусков составили заранее, по статистике: частые сочетания получают отдельный номер, редкие собираются из мелких обрывков.

Метод описали Рико Сеннрих, Барри Хэддоу и Александра Бёрч в работе «Neural Machine Translation of Rare Words with Subword Units» на arXiv в 2015 году. Они применили к словарю алгоритм сжатия byte pair encoding и получили прирост качества перевода: на 1,1 BLEU для пары английский–немецкий и на 1,3 BLEU для пары английский–русский.

Проверить механику можно за минуту. Библиотека tiktoken отдаёт для модели gpt-4o токенизатор o200k_base. Мы прогнали через него слово «нейросеть» и получили три куска: «ней», «рос», «еть». Английское neural тот же токенизатор разбил на два. А «Здравствуйте» уместилось в один токен целиком — настолько часто это слово попадалось в обучающих данных.

Дальше каждый токен превращается в вектор, то есть в длинный список чисел, и уже он уходит в первый слой сети. Ответ модель собирает так же: считает вероятности для всех вариантов продолжения, выбирает один токен, дописывает его к тексту и начинает сначала. Кусок за куском.

Из токенов складывается и счёт за работу модели, и предел длины разговора. Механику расхода мы разобрали отдельно: в статье про токены в нейросети есть замеры на русском и английском, а также способ посчитать траты заранее.

Как работает внимание — приём, на котором стоят современные модели

Механизм внимания: модель подсвечивает связанные слова в предложении при генерации следующего токена

Обрабатывая очередной токен, модель смотрит сразу на все остальные токены запроса и решает, какие из них сейчас важны. В предложении «кот сидел на коврике, потому что он устал» слово «он» относится к коту. Механизм внимания вычисляет именно эту связь: ставит высокий вес паре «он — кот» и низкий паре «он — коврик».

Приём описан в статье «Attention Is All You Need», которую Ашиш Васвани с соавторами опубликовали на arXiv в 2017 году. Они предложили архитектуру трансформера, полностью отказавшись и от рекуррентных связей, и от свёрток. Результат: 28,4 BLEU на переводе с английского на немецкий (WMT 2014) и 41,8 BLEU на паре английский–французский. Обучение заняло 3,5 суток на восьми видеокартах и обошлось заметно дешевле, чем у прежних рекордсменов.

До трансформера тексты обрабатывали последовательно, слово за словом, и связь между началом и концом длинного абзаца терялась. Внимание сняло это ограничение и заодно позволило считать всё параллельно. Отсюда рывок качества последних лет: на этой архитектуре построены и GPT, и Claude, и Gemini — то есть почти всё, чем сегодня пользуются в чатах.

У приёма есть цена. Внимание сравнивает каждый токен с каждым, поэтому объём вычислений растёт быстрее, чем сам текст. Из-за этого у моделей и появляется предел: за один заход модель удерживает ограниченный объём текста.

Почему нейросеть забывает начало разговора?

Модель забывает начало, когда разговор перестаёт помещаться в контекстное окно. Окно — это вся память модели на время одного запроса: системная инструкция, ваши сообщения, её собственные ответы и приложенные файлы. Между запросами не сохраняется ничего, поэтому историю переписки чат отправляет модели заново каждый раз.

По документации Anthropic о контекстных окнах, у Claude Opus 4.7 и Claude Sonnet 4.6 окно достигает миллиона токенов, у остальных моделей семейства — 200 тысяч. Там же предупреждают: с ростом числа токенов точность и полнота выборки падают. Явление называют context rot — большое окно само по себе качества не гарантирует.

Вывод отсюда простой: длинную переписку лучше резать. Закончили тему — открывайте новый диалог и переносите туда выжимку. Размеры окон у ходовых моделей и способы обойти лимит мы собрали в разборе контекстного окна нейросети.

Чем отличаются нейросети для текста, картинок и видео?

Разница в архитектуре и в том, что модель предсказывает на каждом шаге. Языковая модель угадывает следующий токен текста. Генератор картинок начинает со случайного шума и за десятки шагов вычищает из него изображение, ориентируясь на описание. Видеомодель делает то же самое, но следит ещё и за тем, чтобы соседние кадры не разъезжались.

Тип моделиЧто предсказываетЧто получает на входеТипичный результат
Языковая (трансформер)следующий токен текстатекст, иногда картинкуответ, код, перевод
Диффузионная для картинокшум, который надо убрать с изображениятекстовое описаниекартинка по описанию
Видеомодельпоследовательность кадровтекст или стартовое фоторолик на несколько секунд
Речеваязвуковая волна по текстутекст и параметры голосаозвучка

Свёрточные сети из старых объяснений никуда не делись: обработка изображений, распознавание лиц, анализ медицинских снимков по-прежнему во многом держатся на них. Просто в чатах их сменил трансформер. В каталоге Trackly эти семейства лежат рядом: текст в чате обрабатывает GPT-5 mini, картинки рисуют Nano Banana и Imagen 4, за видео отвечают Veo 3.1 и Kling 3.0. Полный список — в каталоге моделей.

Почему нейросеть уверенно выдумывает факты?

Нейросеть выдаёт уверенный ответ с выдуманной ссылкой, рядом человек сверяет данные с первоисточником

Потому что модель предсказывает правдоподобное продолжение, а не проверяет истину. Отдельного механизма «а точно ли это так» у неё нет: есть вероятности следующего токена, и самый вероятный вариант выигрывает. Если в обучающих данных о вашем вопросе почти ничего не было, статистика всё равно предложит гладкий и уверенный по форме ответ.

Выдумки вылезают там, где нужна точность: даты, номера стандартов, цитаты, ссылки, имена авторов. Форма при этом остаётся безупречной, и в этом главный подвох — неправда выглядит ровно так же, как правда.

Способы снизить риск известны: просить модель опираться на приложенный текст, требовать прямые цитаты из источника, задавать один и тот же вопрос дважды и сравнивать ответы. Как устроены эти ошибки и что с ними делать — в материале про галлюцинации нейросетей.

Где попробовать нейросеть на русском без VPN?

Проще всего открыть чат и задать вопрос: теория укладывается в голове быстрее, когда рядом работает живой пример. На Trackly чат с нейросетью доступен из России без VPN, интерфейс и ответы на русском, оплата российской картой в рублях. Один ответ в чате стоит 20 токенов с общего баланса.

Начать можно бесплатно: после регистрации по email на баланс приходит приветственный бонус, и его хватает на первые запросы. Дальше токены докупают в любом объёме и тратят на что угодно — от текста до видео.

Попробуйте проверить прочитанное руками. Задайте один и тот же вопрос быстрой и медленной модели и сравните ответы. Спросите что-нибудь, потом уточните вопрос — и посмотрите, как меняется результат, когда в окне появляется контекст. Это объяснит больше, чем ещё десять страниц теории.

Источники

Поделиться: TelegramVKWhatsApp

Частые вопросы

Как нейросеть учится?+

Нейросеть учится методом обратного распространения ошибки. Она делает предсказание, сравнивает его с правильным ответом, считает величину промаха и прогоняет промах обратно по слоям. Каждый вес получает свою долю вины и сдвигается в сторону, которая уменьшит ошибку.

Почему нейросеть читает текст не буквами?+

Языковая модель не видит ни букв, ни слов — она видит токены. Токен — это кусок текста длиной от одного символа до целого слова. Набор таких кусков составлен заранее по статистике, а затем каждый токен превращается в вектор чисел.

Почему нейросеть забывает начало разговора?+

Модель забывает начало, когда разговор перестаёт помещаться в контекстное окно. Это вся память модели на время одного запроса, включая системную инструкцию, ваши сообщения и её ответы. Между запросами история переписки отправляется заново каждый раз.

Почему нейросеть выдумывает факты?+

Нейросеть выдумывает факты, потому что предсказывает правдоподобное продолжение, а не проверяет истину. Отдельного механизма проверки у неё нет, и она выбирает самый вероятный вариант следующего токена. Если данных по вопросу мало, статистика всё равно предложит уверенный ответ.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly