Модели

Whisper нейросеть: что это и как работает?

Шесть размеров Whisper от tiny до large выстроены лесенкой по объёму параметров, демонстрируя разнообразие моделей нейросети для распознавания речи.

Коротко

Whisper — это нейросеть от OpenAI для распознавания речи, выпущенная под лицензией MIT. Она обучена на 680 000 часах аудио, что обеспечивает высокую устойчивость к акцентам и шумам. Модель имеет шесть размеров и три поколения, её можно запустить локально или через API. Точность распознавания русской речи варьируется от 1,7% до 24,8% WER в зависимости от качества записи и размера модели.

Содержание
  1. Что такое Whisper и чем он отличается от онлайн-сервиса?
  2. Какие версии Whisper существуют?
  3. Насколько точно Whisper распознаёт русскую речь?
  4. Три способа запустить Whisper
  5. Сколько нужно железа и места на диске?
  6. Где Whisper ошибается чаще всего?
  7. Whisper, транскрибация и субтитры: что есть что
  8. Что делать с готовой расшифровкой?
  9. Источники

Что такое Whisper и чем он отличается от онлайн-сервиса?

Whisper — это модель, а не сайт с кнопкой «загрузить файл». OpenAI выложила код и веса на GitHub под лицензией MIT, репозиторий openai/whisper создан 16 сентября 2022 года. Скачать и запустить у себя можно бесплатно, в том числе в коммерческом проекте: MIT этого не запрещает.

В статье «Robust Speech Recognition via Large-Scale Weak Supervision» (Radford и соавторы, 6 декабря 2022 года) сказано, что Whisper обучали на 680 000 часов речи, собранной из интернета вместе с готовыми расшифровками. Такой объём дал устойчивость к акценту и фоновому шуму без дообучения под отдельный язык. Авторы называют это zero-shot переносом: модель не видела ваш датасет и всё равно работает.

Отсюда путаница в выдаче. По запросу «whisper нейросеть» половина ссылок ведёт на сервисы формата «загрузите файл — получите текст». Внутри у них та же модель с GitHub. Деньги берут за то, что кто-то держит сервер и не заставляет ставить Python.

У этого удобства есть цена помимо денег. Файл уезжает на чужой диск. Для записи созвона с персональными данными клиентов локальный запуск снимает вопрос целиком.

Какие версии Whisper существуют?

Шесть размеров модели плюс три поколения самой крупной. Таблица из README репозитория:

РазмерПараметрыВидеопамятьСкорость
tiny39 млн~1 ГБ~10×
base74 млн~1 ГБ~7×
small244 млн~2 ГБ~4×
medium769 млн~5 ГБ~2×
large1550 млн~10 ГБ
turbo809 млн~6 ГБ~8×

Поколения large различаются заметно. В карточке модели large-v3 на Hugging Face указано: 1,55 млрд параметров, обучение на 1 млн часов слабо размеченного аудио плюс 4 млн часов псевдоразмеченного, поддержка 99 языков и снижение числа ошибок на 10–20% относительно large-v2. Число мел-фильтров на входе выросло с 80 до 128 — из-за этого веса v2 и v3 несовместимы между собой.

Модель turbo — урезанный large-v3. README описывает её как оптимизированную версию с минимальной потерей точности: параметров вдвое меньше, скорость примерно в восемь раз выше. Для расшифровки на ноутбуке это разумный выбор по умолчанию.

Неочевидная деталь, которой нет в русских пересказах: официальный репозиторий фактически заморожен. Последний релиз — тег v20250625 от 26 июня 2025 года, больше года без нового. Развитие ушло в сторонние сборки: whisper.cpp выпустил версию 1.9.2 четвёртого августа 2026 года. Ставить сегодня «оригинальный Whisper» ради свежести смысла нет.

Шесть размеров Whisper от tiny до large выстроены лесенкой по объёму параметров

Насколько точно Whisper распознаёт русскую речь?

На чистой записи — хорошо, на плохой — резко хуже, и разница измеряется в разы. Мы прогнали собственный замер, потому что в выдаче по русским запросам цифр почти нет: сервисы пишут «высокая точность» и не уточняют, при каких условиях.

Что делали: сорокапятисекундный монолог на русском, синтезированный речевой моделью, затем две испорченные копии того же файла через ffmpeg — коричневый шум с отношением сигнал/шум 10 дБ и телефонная полоса 300–3400 Гц с шумом на 5 дБ. Распознавали через faster-whisper 1.2.1 на процессоре, четыре потока, квантование int8. Считали WER — долю слов, которые пришлось бы править.

Условие записиbasesmalllarge-v3
Студийная чистота6,8%5,1%1,7%
Фоновый шум, 10 дБ15,4%6,8%3,4%
Телефонная полоса + шум, 5 дБ24,8%12,8%6,0%

Читать это надо с оговоркой: речь синтезированная, один голос, без перебивок и акцента. Реальная встреча даст цифры хуже. Но соотношение показательно — при переходе от студийной записи к телефонной base ошибается вчетверо чаще, а large-v3 всего втрое, оставаясь при этом в границах, где текст ещё читается.

Отдельная находка, которая портит любые автоматические замеры. Первый вариант текста содержал цифры: проценты, дату, доли. Модель написала их как «2,3%» и «12 июня», а эталон хранил их словами. Формально это ошибки распознавания, фактически — разное оформление одного и того же. WER подскочил вдвое на ровном месте. Если вы сверяете расшифровку с эталоном скриптом, числа нужно приводить к одному виду до подсчёта, иначе крупная модель проиграет мелкой.

Три способа запустить Whisper

Официальный пакет

Установка — pip install -U openai-whisper, плюс ffmpeg в системе. Дальше README показывает вызов из командной строки: whisper audio.mp3 --model turbo. Язык можно не угадывать, а задать: --language Russian. Ключ --task translate включает перевод, но только на английский — других направлений у модели нет.

faster-whisper и whisper.cpp

Обе сборки считают ту же модель быстрее. Faster-whisper переписан на движке CTranslate2 и заявляет ускорение до четырёх раз при той же точности. В бенчмарке из README: тринадцать минут аудио, модель large-v2 на видеокарте, beam size 5 — оригинал 2 минуты 23 секунды и 4708 МБ видеопамяти, faster-whisper 1 минута 3 секунды и 4525 МБ, а в режиме int8 — 59 секунд и 2926 МБ.

Whisper.cpp — порт на чистом C++ без зависимостей, тоже под MIT. Он собирается под macOS, Windows, Linux, Android и даже WebAssembly, умеет Core ML на Apple Silicon и CUDA на NVIDIA. Это вариант для тех, кому Python в проекте не нужен.

Через чужой API

Если возиться с железом не хочется, модель доступна как сервис. В документации OpenAI по речи модель whisper-1 описана так: поддержка 98 языков, файл до 25 МБ, форматы mp3, mp4, mpeg, mpga, m4a, wav и webm. Она же единственная из линейки отдаёт готовые субтитры в srt и vtt и умеет тайм-коды на уровне слов через timestamp_granularities. Потоковый режим whisper-1 не поддерживает — только целый файл.

Сколько нужно железа и места на диске?

Меньше, чем принято думать: старый ноутбук справится, если взять размер поменьше. Таблица весов из README whisper.cpp: tiny занимает 75 МиБ на диске и ~273 МБ памяти, base — 142 МиБ и ~388 МБ, small — 466 МиБ и ~852 МБ, medium — 1,5 ГиБ и ~2,1 ГБ, large — 2,9 ГиБ и ~3,9 ГБ.

Наш замер на обычном сервере без видеокарты, четыре потока процессора: small прошла сорокапятисекундный файл за 24 секунды, large-v3 — за 103 секунды. То есть час записи на процессоре large-v3 переварит примерно за два с половиной часа. Для разовой расшифровки терпимо, для потока — уже нет, там нужна видеокарта или API.

Требования Whisper к памяти и месту на диске для разных размеров модели

Где Whisper ошибается чаще всего?

Слабых мест четыре, и все они известны разработчикам.

Первое — галлюцинации на тишине. На паузах и музыкальных вставках модель дописывает фразы, которых не было. В WhisperX эту беду лечат детектором речи на входе: README прямо говорит, что предварительный VAD снижает галлюцинации без потери точности.

Второе — тайм-коды: штатный Whisper выдаёт границы на уровне реплики, а не слова, и промахивается на несколько секунд. Для субтитров это критично, поэтому поверх ставят выравнивание по фонемам.

Третье — говорящие. Модель не разделяет голоса и отдаёт сплошной текст. Документация Microsoft по Whisper в Azure фиксирует это буквально: диаризация через Azure OpenAI не поддерживается, за ней нужно идти в пакетную транскрипцию Azure Speech. Там же ограничения расходятся — 25 МБ у одного пути против файлов до 1 ГБ у другого, а имя файла в Azure OpenAI принимается только из ASCII-символов.

Четвёртое — реальное время. В таблице сценариев Microsoft напротив строки «расшифровка в режиме реального времени и субтитры» у Whisper стоит «Недоступно». Модель рассчитана на готовый файл.

Whisper, транскрибация и субтитры: что есть что

Три слова из одной области, но означают разное, и путаница мешает выбирать инструмент.

Whisper — модель. Это движок распознавания, кусок кода с весами, у него нет интерфейса и он ничего не решает сам.

Транскрибация — задача. Превратить запись встречи, интервью или лекции в читаемый текст: с абзацами, знаками препинания и пометками, кто говорит. Whisper закрывает здесь только первый шаг, остальное делают надстройки и редактура. Как это устроено целиком, разобрано в статье про нейросети для транскрибации аудио и видео.

Субтитры — тоже задача, но с другими требованиями. Там важен не столько текст, сколько тайминги, длина строки и формат файла. Про SRT, VTT и то, почему дорожка разъезжается, есть отдельный разбор как нейросети делают субтитры.

Есть и обратная операция — синтез речи из текста. Она устроена иначе и в Whisper не входит; про голоса и качество озвучки мы писали в отдельном материале.

Один голос в шумной комнате: чем хуже запись, тем больше ошибок в расшифровке

Что делать с готовой расшифровкой?

Сырой вывод Whisper читать неудобно, и это нормальная стадия работы. Модель отдаёт поток предложений без структуры: кто говорил, где закончилась одна тема и началась другая — всё это придётся расставлять отдельно.

Распознавания речи у нас в каталоге нет. Whisper запускают у себя или берут у сервисов, которые его хостят, и обещать здесь доступ было бы враньём. Полезны мы на следующем шаге. Расшифровку удобно скормить текстовой модели и попросить протокол: список решений, задачи с исполнителями, спорные места. Claude Sonnet держит длинный контекст и переваривает часовую встречу целиком, GPT-5 mini дешевле и годится для коротких записей. Работает без VPN, оплата в рублях.

Обратная задача тоже закрыта: озвучка текста голосом стоит 20 токенов за запуск. Полезно, когда из готовой расшифровки нужно собрать аудиоверсию.

Если хочется держать всё на своей машине, включая распознавание, посмотрите разбор про локальные нейросети и их требования к железу — Whisper там один из самых нетребовательных вариантов.

Источники

  • openai/whisper — репозиторий, лицензия MIT, таблица размеров, команды запуска. Проверено 7 августа 2026.
  • Robust Speech Recognition via Large-Scale Weak Supervision — статья Radford и соавторов, 680 000 часов обучения. Проверено 7 августа 2026.
  • openai/whisper-large-v3 — карточка модели: параметры, объём данных, 99 языков. Проверено 7 августа 2026.
  • Speech to text, OpenAI — лимит 25 МБ, форматы, srt и vtt. Проверено 7 августа 2026.
  • Модель Whisper из OpenAI, Microsoft Learn — диаризация, лимиты, реальное время. Проверено 7 августа 2026.
  • faster-whisper — CTranslate2, бенчмарки скорости и памяти. Проверено 7 августа 2026.
  • whisper.cpp — порт на C++, вес моделей на диске, версия 1.9.2. Проверено 7 августа 2026.
  • WhisperX — VAD против галлюцинаций, тайм-коды по словам. Проверено 7 августа 2026.
Поделиться: TelegramVKWhatsApp

Частые вопросы

Что такое Whisper нейросеть?+

Whisper — это модель распознавания речи, разработанная OpenAI. Она была выпущена под лицензией MIT в сентябре 2022 года. Модель обучена на 680 000 часах аудио и предназначена для преобразования речи в текст, поддерживая множество языков.

Какие версии Whisper существуют?+

Существует шесть размеров модели Whisper: tiny, base, small, medium, large и turbo. Кроме того, есть три поколения самой крупной модели large, которые различаются объёмом параметров и данными обучения. Например, large-v3 поддерживает 99 языков и имеет 1,55 млрд параметров.

Насколько точно Whisper распознаёт русскую речь?+

Точность распознавания русской речи Whisper зависит от качества записи. На студийной записи модель large-v3 показала 1,7% WER, тогда как на телефонной полосе с шумом 5 дБ WER вырос до 6,0%. Модель base в тех же условиях дала 6,8% и 24,8% WER соответственно.

Как запустить Whisper нейросеть?+

Whisper можно запустить тремя способами: через официальный пакет `openai-whisper` с помощью pip, используя оптимизированные сборки вроде faster-whisper или whisper.cpp для более быстрой работы, или через сторонний API, например, `whisper-1` от OpenAI.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly