Нейросеть для транскрибации: что умеет?

Коротко
Нейросеть для транскрибации превращает звук в читаемый текст, расставляя знаки препинания и разделяя говорящих. Точность расшифровки русской речи зависит от качества записи, а не только от модели. Плохая запись с обрезанными частотами снижает точность до 20,2%, тогда как фоновый шум влияет меньше. Готовый протокол получается после обработки текста языковой моделью.
Содержание
Что делает нейросеть для транскрибации?
Превращает звук в текст, который можно читать глазами. Формально задача одна, на практике она распадается на четыре части: распознать слова, расставить знаки препинания, понять, кто из участников говорит, и разбить сплошной поток на абзацы.
За каждую часть отвечает свой инструмент. Слова снимает модель распознавания речи. Голоса разводит отдельная модель диаризации, которую ставят рядом. Знаки препинания появляются сами, вместе с текстом. А деление на темы и абзацы приходится доверять либо человеку, либо языковой модели на следующем шаге. Сервис формата «всё в одном» просто прячет эту цепочку за одной кнопкой — и ломается она тоже по частям.
Дальше начинается вторая половина работы, о которой обзоры сервисов обычно молчат. Сырой вывод выглядит как поток фраз без деления на реплики: прочитать час встречи в таком виде тяжелее, чем переслушать запись.
Поэтому расшифровка и «текст из аудио» — разные по трудоёмкости вещи. Получить строку символов легко. Получить документ, по которому потом ищут договорённости, — задача из нескольких шагов.
Насколько точно расшифровывают русскую речь?
Точность решает не столько модель, сколько запись. Мы проверяли это на собственном замере, потому что в подборках «топ-5 нейросетей для транскрибации» цифр нет вовсе — только галочки в таблицах возможностей.
Вывод из него короткий: фоновый шум почти не мешает распознаванию, а срезанная телефонная полоса поднимает долю ошибок в разы, причём на любом размере модели. Условия, способ подсчёта и проценты по трём моделям мы разобрали в статье про Whisper.
Оговорка к таким замерам всегда одна: их делают на стерильном материале — один голос, ни перебивок, ни акцента. Это потолок возможного. Живая встреча даст результат хуже любой опубликованной таблицы, и время на вычитку планировать надо от неё, а не от красивой цифры в обзоре.

Что делать с плохой записью?
Главное — не пытаться вытянуть её моделью потяжелее. Шум и узкая полоса частот ломают распознавание по-разному, и это принципиальная разница. Шум добавляет к сигналу лишнее, и лишнее модель в основном отфильтровывает. Полоса 300–3400 Гц, наоборот, вычитает из сигнала часть спектра — те самые верхние частоты, по которым различаются «с», «ш», «ф» и «т». Восстанавливать там нечего: удалённых частот в файле уже нет, шумоподавление их не вернёт.
Практический вывод получается не про нейросети, а про технику записи. Шумный кабинет пережить можно. Запись созвона «телефоном с громкой связи» или диктофоном в кармане — нет, и никакая модель этого не исправит.
Что помогает до записи: пишите каждого участника отдельной дорожкой, если платформа умеет; ставьте микрофон ближе ко рту, а не в центр стола; выключайте агрессивное шумоподавление в мессенджере, оно режет речь вместе с шумом.
Что помогает после: подсказать модели язык явно. Документация Microsoft по Whisper прямо советует передавать поле language в запросе и отмечает, что языковые подсказки повышают стабильность на коротких и зашумлённых записях. Без подсказки модель определяет язык по первым секундам и на плохом звуке иногда ошибается — тогда русская речь уезжает в транслит.
Как нейросеть разделяет говорящих?
Отдельной моделью, которую ставят рядом с распознаванием. Сам Whisper голоса не различает и отдаёт сплошной текст: в документации Microsoft сказано буквально, что диаризация в Azure OpenAI не поддерживается — за разделением дикторов отправляют в другой продукт, пакетную транскрипцию Azure Speech. Лимиты у этих двух путей тоже разные: 25 МБ на файл против 1 ГБ.
Открытый стандарт разделения дикторов — pyannote.audio. Код под лицензией MIT, версия 4.0.7 вышла 30 июня 2026 года, актуальный конвейер называется speaker-diarization-community-1. Веса не скачиваются свободно: README требует принять условия на Hugging Face и завести токен доступа. Про этот шаг обычно узнают уже посреди настройки, когда скрипт падает на загрузке весов.
Качество измеряют долей неверно приписанного времени — DER. Авторы приводят замеры на тринадцати наборах данных, включая CALLHOME, AMI и DIHARD 3; на последнем открытый конвейер даёт 20,2% ошибки против 14,7% у платного. То есть примерно каждая пятая секунда разговора приписывается не тому человеку. Ждать от автоматической разметки готового протокола с именами не стоит — реплики придётся сверять.

Если разделение критично, есть готовая связка: WhisperX соединяет распознавание, выравнивание по словам и диаризацию через pyannote в один конвейер. Лицензия у него BSD-2-Clause, последняя версия 3.8.6 от 25 мая 2026 года.
Локально или через сервис: что выбрать?
По записям с чужими персональными данными — локально, по всему остальному считайте время.
Локальный запуск бесплатен и ничего не отправляет наружу. Модель small весит 466 МиБ на диске и просит около 852 МБ памяти, large — 2,9 ГиБ и порядка 3,9 ГБ; цифры из README проекта whisper.cpp. Видеокарта не обязательна. На процессоре без неё base укладывается примерно в четверть длительности записи, small — в половину, а large-v3 считает вдвое дольше, чем длится аудио. Час встречи на крупной модели — это около двух часов ожидания.
Сервис берёт деньги, зато отдаёт результат сразу и обычно сам делает диаризацию. У него свои ограничения: в документации OpenAI для модели whisper-1 заявлены 98 языков, потолок в 25 МБ на файл и семь входных форматов — от mp3 и m4a до mp4 и webm. Часовая встреча в приличном качестве в 25 МБ не влезает, файл придётся резать или пережимать.
Разбор локального сценария целиком, с требованиями к железу под разные задачи, у нас есть в статье про локальные нейросети на своём компьютере. Про саму модель распознавания, её размеры и точность — в материале про Whisper от OpenAI.
Сколько времени занимает расшифровка часа записи?
От четверти часа до двух часов на процессоре и считаные минуты на видеокарте. Разброс объясняется размером модели и способом запуска, а не «скоростью нейросети» вообще.
Быстрее всего работают переписанные сборки. Faster-whisper считает ту же модель на движке CTranslate2 и обещает выигрыш до четырёх раз без потери качества. Цифры из README проекта: тринадцать минут аудио, large-v2, видеокарта, beam size 5 — исходная реализация укладывается в 2 минуты 23 секунды, сборка на CTranslate2 — в 1 минуту 3 секунды, а с квантованием int8 — в 59 секунд и вдвое меньшую видеопамять. На процессоре разрыв ещё заметнее: small оригинал считает 6 минут 58 секунд, faster-whisper с int8 — 1 минуту 42 секунды.
Отсюда практическое правило. Если расшифровка нужна изредка — хватит процессора и модели small. Если это поток и сроки, экономить время дешевле видеокартой, а не выбором «более умной» модели.
Как превратить расшифровку в протокол
Отдать текст языковой модели и попросить структуру. Это второй шаг, без которого расшифровка остаётся сырьём.
Распознавания речи в нашем каталоге нет, и обещать к нему доступ мы не будем. Whisper и его сборки запускают у себя или берут у сторонних сервисов. Полезны мы дальше по цепочке — когда текст уже есть и его надо превратить в документ.
Работающий запрос описывает формат ответа, а не просит «сделать хорошо»: список принятых решений, задачи с исполнителями и сроками, вопросы без ответа, спорные места с указанием, кто возражал. У Claude Sonnet контекстное окно позволяет закинуть расшифровку часовой встречи одним куском, Gemini 2.5 Pro хорошо собирает конспект из рыхлого текста. Оплата в рублях, VPN не нужен.
Работает это и в обратную сторону. Когда из готового документа нужна аудиоверсия — скажем, прослушать протокол за рулём, — синтез речи обойдётся в 20 токенов за один запуск.

Чего ждать не стоит
Идеальной расшифровки без вычитки. Даже на стерильной записи с одним голосом крупная модель спотыкается, как только звук проходит через телефонную полосу. На живой встрече ошибок будет больше.
Имён и терминов из коробки. Фамилии, названия продуктов и отраслевой жаргон модель угадывает по звучанию и регулярно мимо. Список имён участников, переданный подсказкой, снимает часть проблемы, но не всю.
Расстановки чисел в одном виде. При расшифровке русской речи крупные модели пишут «2,3%» цифрами, мелкие — словами; в пределах одного файла оформление может гулять.
Разбора одновременной речи. Когда двое говорят разом, распознавание склеивает реплики, а диаризация теряет границу. Тот же эффект ломает и субтитры — про это подробнее в разборе про субтитры и тайминги.
Источники
Все ссылки проверены 7 августа 2026 года.
- Речь в текст, документация OpenAI API — ограничения: размер файла, список языков, входные форматы.
- Whisper в Azure, справка Microsoft — что умеет Azure OpenAI, а что вынесено в пакетную транскрипцию; языковые подсказки.
- pyannote.audio — конвейер community-1, DER на DIHARD 3, доступ через Hugging Face.
- WhisperX — связка распознавания, выравнивания и диаризации.
- faster-whisper — замеры скорости на процессоре и видеокарте.
- whisper.cpp — вес моделей на диске и требования к памяти.
Частые вопросы
Что делает нейросеть для транскрибации?+
Нейросеть для транскрибации превращает звук в текст. Задача включает распознавание слов, расстановку знаков препинания, определение говорящих и деление текста на абзацы. Сырой вывод — это поток фраз, который требует дальнейшей обработки для получения читаемого документа.
Насколько точно нейросеть расшифровывает русскую речь?+
Точность зависит прежде всего от качества записи, а не от размера модели. Чистая студийная речь расшифровывается почти без ошибок, фоновый шум мешает слабо, а вот срезанная телефонная полоса частот поднимает долю ошибок в разы: вместе с верхними частотами теряются признаки, по которым различаются согласные. Замеры по размерам модели мы приводим в статье про Whisper.
Как нейросеть разделяет говорящих?+
Нейросеть разделяет говорящих с помощью отдельной модели, например pyannote.audio. Сам Whisper голоса не различает и отдаёт сплошной текст. Качество разделения измеряется долей неверно приписанного времени (DER), которая может достигать 20,2% на сложных наборах данных.
Сколько времени занимает расшифровка часа записи?+
Расшифровка часа записи занимает от четверти часа до двух часов на процессоре. Например, 45-секундный файл модель large-v3 обработала за 90 секунд на процессоре. На видеокарте процесс ускоряется до считанных минут, faster-whisper может быть до четырёх раз быстрее.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly