Как аудио превращается в текст
Вы прикладываете файл и выбираете две настройки. Дальше звуковая дорожка уходит в модель Gemini от Google, та распознаёт речь вместе с метками времени, и реплики складываются в готовый текст по порядку. Обработка занимает секунды, потому что считает наш сервер, а не ваш телефон.
Ответ приходит одним сообщением. Его можно скопировать целиком, вычитать опечатки и использовать дальше — выложить под выпуском, разобрать интервью на цитаты, собрать заметки после совещания. Сам аудиофайл остаётся в переписке рядом с расшифровкой, так что через неделю видно, откуда он взялся.
Какие записи несут сюда чаще всего
Чаще всего диктофон. Студенты, журналисты, продавцы записывают разговор на телефон, а потом им нужен текст, а не двадцать минут переслушивания. Диктофонная запись читается так же, как любое другое аудио.
Второй случай — голосовые. Сообщение на три минуты быстрее прочитать, чем выслушать, особенно если собеседник говорит медленно и с паузами.
Дальше идут подкаст, интервью, лекция, созвон и совещание. Тут расшифровка нужна не ради самой расшифровки, а чтобы найти ключевой момент и вытащить пару цитат. Для этого и придуманы метки времени.
Форматы, вес и длина аудио
Аудио принимаем в mp3, m4a, wav и ogg — это ровно то, в чём сохраняют звук телефон, диктофон и мессенджер. Перекодировать формат заранее не нужно. Видео тоже подойдёт, звуковая дорожка вынимается из него автоматически.
Потолок — 3 минуты и 300 МБ. Загрузить нужно сам файл с устройства, поля для ссылки на странице нет, так что чужой выпуск по адресу сюда не попадёт.
Если звуковой дорожки в файле нет, загрузка отклоняется сразу, ещё до списания токенов. Распознаётся только речь. Музыку и шум нейросеть не описывает, а неразборчивое место пропускает, а не придумывает слово за говорящего.
Сплошное полотно или таймкоды
| Настройка | Варианты | Что меняет |
|---|---|---|
| Язык текста | как в записи, русский, английский | язык готовой расшифровки |
| Вид текста | сплошной, с тайм-кодами | есть ли в тексте метки времени |
Сплошной вид — это одно полотно без разметки, и полотно тут слово буквальное. Трёхминутная запись придёт единым абзацем, без переносов строк, потому что абзацы модель не расставляет. Знаки препинания она ставит сама, а разбивать текст по смыслу придётся вам.
Второй вид приходит блоком, где у каждой реплики есть время начала и конца. Такие метки называют таймкодами, и по ним легко вернуться к нужной секунде исходника. Одна реплика занимает не больше двух строк и не больше семи секунд.
Язык переключается на самом распознавании, отдельный прогон переводчика не нужен. Русский и английский доступны сразу и стоят столько же, сколько обычная расшифровка.
Расшифровка, транскрипция, транскрибация
Три слова про одну работу. Расшифровка — обиходное, транскрипция пришла из лингвистики, транскрибация — из фриланса, где текст набирают руками. Разница не в терминах, а в исполнителе. Транскрибировать запись вручную человек будет вечер и возьмёт за это совсем другие деньги, а нейросеть отвечает, пока вы не ушли со страницы.
Чего здесь нет
Диаризации. Пометок вида «спикер 1» и «спикер 2» в тексте не будет, реплики идут сплошным потоком. У части сервисов транскрибации разделение по спикерам есть, и когда в записи спорят трое, разница заметная. Мы её не обещаем — разбирать, кто что сказал, придётся по смыслу.
Экспорта файлом. Вид с тайм-кодами приходит готовой SRT-разметкой в блоке кода, её можно скопировать и сохранить самому, но файлом .srt или .docx карточка результат не отдаёт.
Тарифов и пакетов минут. Вы платите за запуск из общего баланса и только когда действительно расшифровываете файл, поэтому считать остаток минут и следить, сгорят ли они к концу месяца, не нужно.
Согласие и границы
Чужие записи без согласия говорящих расшифровывать не нужно.
Юридической силы у расшифровки нет — для суда и протокола нужен человек.
Медицинские записи не наша зона — приём врача и диагноз разбирать не берёмся.
Если у вас видео, а не аудио
Для видеофайлов есть соседняя страница — расшифровка видео в текст. Механика там та же самая. Приложить ролик можно и здесь, но если вы пришли именно за текстом с записи экрана или с камеры, у соседа эта задача разобрана подробнее. А когда текст нужен не отдельным полотном, а прямо в кадре, это уже субтитры, третья карточка.
Куда отдать готовый текст
Расшифровка редко бывает конечной целью. Была лекция — отдайте текст в конспект лекции, он соберёт короткую выжимку с главными мыслями. Было совещание — протокол встречи превратит разговор в решения и задачи. Обе работают из готового текста, и как раз его даёт расшифровка. В обратную сторону, из текста в голос, работает озвучка, а буквы с фотографии читает распознавание текста с картинки.