Whisper нейросеть: что это и как работает?

Коротко
Whisper — это нейросеть от OpenAI для распознавания речи, выпущенная под лицензией MIT. Она обучена на 680 000 часах аудио, что обеспечивает высокую устойчивость к акцентам и шумам. Модель имеет шесть размеров и три поколения, её можно запустить локально или через API. Точность распознавания русской речи варьируется от 1,7% до 24,8% WER в зависимости от качества записи и размера модели.
Содержание
- Что такое Whisper и чем он отличается от онлайн-сервиса?
- Какие версии Whisper существуют?
- Насколько точно Whisper распознаёт русскую речь?
- Три способа запустить Whisper
- Сколько нужно железа и места на диске?
- Где Whisper ошибается чаще всего?
- Whisper, транскрибация и субтитры: что есть что
- Что делать с готовой расшифровкой?
- Источники
Что такое Whisper и чем он отличается от онлайн-сервиса?
Whisper — это модель, а не сайт с кнопкой «загрузить файл». OpenAI выложила код и веса на GitHub под лицензией MIT, репозиторий openai/whisper создан 16 сентября 2022 года. Скачать и запустить у себя можно бесплатно, в том числе в коммерческом проекте: MIT этого не запрещает.
В статье «Robust Speech Recognition via Large-Scale Weak Supervision» (Radford и соавторы, 6 декабря 2022 года) сказано, что Whisper обучали на 680 000 часов речи, собранной из интернета вместе с готовыми расшифровками. Такой объём дал устойчивость к акценту и фоновому шуму без дообучения под отдельный язык. Авторы называют это zero-shot переносом: модель не видела ваш датасет и всё равно работает.
Отсюда путаница в выдаче. По запросу «whisper нейросеть» половина ссылок ведёт на сервисы формата «загрузите файл — получите текст». Внутри у них та же модель с GitHub. Деньги берут за то, что кто-то держит сервер и не заставляет ставить Python.
У этого удобства есть цена помимо денег. Файл уезжает на чужой диск. Для записи созвона с персональными данными клиентов локальный запуск снимает вопрос целиком.
Какие версии Whisper существуют?
Шесть размеров модели плюс три поколения самой крупной. Таблица из README репозитория:
| Размер | Параметры | Видеопамять | Скорость |
|---|---|---|---|
| tiny | 39 млн | ~1 ГБ | ~10× |
| base | 74 млн | ~1 ГБ | ~7× |
| small | 244 млн | ~2 ГБ | ~4× |
| medium | 769 млн | ~5 ГБ | ~2× |
| large | 1550 млн | ~10 ГБ | 1× |
| turbo | 809 млн | ~6 ГБ | ~8× |
Поколения large различаются заметно. В карточке модели large-v3 на Hugging Face указано: 1,55 млрд параметров, обучение на 1 млн часов слабо размеченного аудио плюс 4 млн часов псевдоразмеченного, поддержка 99 языков и снижение числа ошибок на 10–20% относительно large-v2. Число мел-фильтров на входе выросло с 80 до 128 — из-за этого веса v2 и v3 несовместимы между собой.
Модель turbo — урезанный large-v3. README описывает её как оптимизированную версию с минимальной потерей точности: параметров вдвое меньше, скорость примерно в восемь раз выше. Для расшифровки на ноутбуке это разумный выбор по умолчанию.
Неочевидная деталь, которой нет в русских пересказах: официальный репозиторий фактически заморожен. Последний релиз — тег v20250625 от 26 июня 2025 года, больше года без нового. Развитие ушло в сторонние сборки: whisper.cpp выпустил версию 1.9.2 четвёртого августа 2026 года. Ставить сегодня «оригинальный Whisper» ради свежести смысла нет.

Насколько точно Whisper распознаёт русскую речь?
На чистой записи — хорошо, на плохой — резко хуже, и разница измеряется в разы. Мы прогнали собственный замер, потому что в выдаче по русским запросам цифр почти нет: сервисы пишут «высокая точность» и не уточняют, при каких условиях.
Что делали: сорокапятисекундный монолог на русском, синтезированный речевой моделью, затем две испорченные копии того же файла через ffmpeg — коричневый шум с отношением сигнал/шум 10 дБ и телефонная полоса 300–3400 Гц с шумом на 5 дБ. Распознавали через faster-whisper 1.2.1 на процессоре, четыре потока, квантование int8. Считали WER — долю слов, которые пришлось бы править.
| Условие записи | base | small | large-v3 |
|---|---|---|---|
| Студийная чистота | 6,8% | 5,1% | 1,7% |
| Фоновый шум, 10 дБ | 15,4% | 6,8% | 3,4% |
| Телефонная полоса + шум, 5 дБ | 24,8% | 12,8% | 6,0% |
Читать это надо с оговоркой: речь синтезированная, один голос, без перебивок и акцента. Реальная встреча даст цифры хуже. Но соотношение показательно — при переходе от студийной записи к телефонной base ошибается вчетверо чаще, а large-v3 всего втрое, оставаясь при этом в границах, где текст ещё читается.
Отдельная находка, которая портит любые автоматические замеры. Первый вариант текста содержал цифры: проценты, дату, доли. Модель написала их как «2,3%» и «12 июня», а эталон хранил их словами. Формально это ошибки распознавания, фактически — разное оформление одного и того же. WER подскочил вдвое на ровном месте. Если вы сверяете расшифровку с эталоном скриптом, числа нужно приводить к одному виду до подсчёта, иначе крупная модель проиграет мелкой.
Три способа запустить Whisper
Официальный пакет
Установка — pip install -U openai-whisper, плюс ffmpeg в системе. Дальше README показывает вызов из командной строки: whisper audio.mp3 --model turbo. Язык можно не угадывать, а задать: --language Russian. Ключ --task translate включает перевод, но только на английский — других направлений у модели нет.
faster-whisper и whisper.cpp
Обе сборки считают ту же модель быстрее. Faster-whisper переписан на движке CTranslate2 и заявляет ускорение до четырёх раз при той же точности. В бенчмарке из README: тринадцать минут аудио, модель large-v2 на видеокарте, beam size 5 — оригинал 2 минуты 23 секунды и 4708 МБ видеопамяти, faster-whisper 1 минута 3 секунды и 4525 МБ, а в режиме int8 — 59 секунд и 2926 МБ.
Whisper.cpp — порт на чистом C++ без зависимостей, тоже под MIT. Он собирается под macOS, Windows, Linux, Android и даже WebAssembly, умеет Core ML на Apple Silicon и CUDA на NVIDIA. Это вариант для тех, кому Python в проекте не нужен.
Через чужой API
Если возиться с железом не хочется, модель доступна как сервис. В документации OpenAI по речи модель whisper-1 описана так: поддержка 98 языков, файл до 25 МБ, форматы mp3, mp4, mpeg, mpga, m4a, wav и webm. Она же единственная из линейки отдаёт готовые субтитры в srt и vtt и умеет тайм-коды на уровне слов через timestamp_granularities. Потоковый режим whisper-1 не поддерживает — только целый файл.
Сколько нужно железа и места на диске?
Меньше, чем принято думать: старый ноутбук справится, если взять размер поменьше. Таблица весов из README whisper.cpp: tiny занимает 75 МиБ на диске и ~273 МБ памяти, base — 142 МиБ и ~388 МБ, small — 466 МиБ и ~852 МБ, medium — 1,5 ГиБ и ~2,1 ГБ, large — 2,9 ГиБ и ~3,9 ГБ.
Наш замер на обычном сервере без видеокарты, четыре потока процессора: small прошла сорокапятисекундный файл за 24 секунды, large-v3 — за 103 секунды. То есть час записи на процессоре large-v3 переварит примерно за два с половиной часа. Для разовой расшифровки терпимо, для потока — уже нет, там нужна видеокарта или API.

Где Whisper ошибается чаще всего?
Слабых мест четыре, и все они известны разработчикам.
Первое — галлюцинации на тишине. На паузах и музыкальных вставках модель дописывает фразы, которых не было. В WhisperX эту беду лечат детектором речи на входе: README прямо говорит, что предварительный VAD снижает галлюцинации без потери точности.
Второе — тайм-коды: штатный Whisper выдаёт границы на уровне реплики, а не слова, и промахивается на несколько секунд. Для субтитров это критично, поэтому поверх ставят выравнивание по фонемам.
Третье — говорящие. Модель не разделяет голоса и отдаёт сплошной текст. Документация Microsoft по Whisper в Azure фиксирует это буквально: диаризация через Azure OpenAI не поддерживается, за ней нужно идти в пакетную транскрипцию Azure Speech. Там же ограничения расходятся — 25 МБ у одного пути против файлов до 1 ГБ у другого, а имя файла в Azure OpenAI принимается только из ASCII-символов.
Четвёртое — реальное время. В таблице сценариев Microsoft напротив строки «расшифровка в режиме реального времени и субтитры» у Whisper стоит «Недоступно». Модель рассчитана на готовый файл.
Whisper, транскрибация и субтитры: что есть что
Три слова из одной области, но означают разное, и путаница мешает выбирать инструмент.
Whisper — модель. Это движок распознавания, кусок кода с весами, у него нет интерфейса и он ничего не решает сам.
Транскрибация — задача. Превратить запись встречи, интервью или лекции в читаемый текст: с абзацами, знаками препинания и пометками, кто говорит. Whisper закрывает здесь только первый шаг, остальное делают надстройки и редактура. Как это устроено целиком, разобрано в статье про нейросети для транскрибации аудио и видео.
Субтитры — тоже задача, но с другими требованиями. Там важен не столько текст, сколько тайминги, длина строки и формат файла. Про SRT, VTT и то, почему дорожка разъезжается, есть отдельный разбор как нейросети делают субтитры.
Есть и обратная операция — синтез речи из текста. Она устроена иначе и в Whisper не входит; про голоса и качество озвучки мы писали в отдельном материале.

Что делать с готовой расшифровкой?
Сырой вывод Whisper читать неудобно, и это нормальная стадия работы. Модель отдаёт поток предложений без структуры: кто говорил, где закончилась одна тема и началась другая — всё это придётся расставлять отдельно.
Распознавания речи у нас в каталоге нет. Whisper запускают у себя или берут у сервисов, которые его хостят, и обещать здесь доступ было бы враньём. Полезны мы на следующем шаге. Расшифровку удобно скормить текстовой модели и попросить протокол: список решений, задачи с исполнителями, спорные места. Claude Sonnet держит длинный контекст и переваривает часовую встречу целиком, GPT-5 mini дешевле и годится для коротких записей. Работает без VPN, оплата в рублях.
Обратная задача тоже закрыта: озвучка текста голосом стоит 20 токенов за запуск. Полезно, когда из готовой расшифровки нужно собрать аудиоверсию.
Если хочется держать всё на своей машине, включая распознавание, посмотрите разбор про локальные нейросети и их требования к железу — Whisper там один из самых нетребовательных вариантов.
Источники
- openai/whisper — репозиторий, лицензия MIT, таблица размеров, команды запуска. Проверено 7 августа 2026.
- Robust Speech Recognition via Large-Scale Weak Supervision — статья Radford и соавторов, 680 000 часов обучения. Проверено 7 августа 2026.
- openai/whisper-large-v3 — карточка модели: параметры, объём данных, 99 языков. Проверено 7 августа 2026.
- Speech to text, OpenAI — лимит 25 МБ, форматы, srt и vtt. Проверено 7 августа 2026.
- Модель Whisper из OpenAI, Microsoft Learn — диаризация, лимиты, реальное время. Проверено 7 августа 2026.
- faster-whisper — CTranslate2, бенчмарки скорости и памяти. Проверено 7 августа 2026.
- whisper.cpp — порт на C++, вес моделей на диске, версия 1.9.2. Проверено 7 августа 2026.
- WhisperX — VAD против галлюцинаций, тайм-коды по словам. Проверено 7 августа 2026.
Частые вопросы
Что такое Whisper нейросеть?+
Whisper — это модель распознавания речи, разработанная OpenAI. Она была выпущена под лицензией MIT в сентябре 2022 года. Модель обучена на 680 000 часах аудио и предназначена для преобразования речи в текст, поддерживая множество языков.
Какие версии Whisper существуют?+
Существует шесть размеров модели Whisper: tiny, base, small, medium, large и turbo. Кроме того, есть три поколения самой крупной модели large, которые различаются объёмом параметров и данными обучения. Например, large-v3 поддерживает 99 языков и имеет 1,55 млрд параметров.
Насколько точно Whisper распознаёт русскую речь?+
Точность распознавания русской речи Whisper зависит от качества записи. На студийной записи модель large-v3 показала 1,7% WER, тогда как на телефонной полосе с шумом 5 дБ WER вырос до 6,0%. Модель base в тех же условиях дала 6,8% и 24,8% WER соответственно.
Как запустить Whisper нейросеть?+
Whisper можно запустить тремя способами: через официальный пакет `openai-whisper` с помощью pip, используя оптимизированные сборки вроде faster-whisper или whisper.cpp для более быстрой работы, или через сторонний API, например, `whisper-1` от OpenAI.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly