Как работает расшифровка видео в текст
Вы прикладываете файл и выбираете две настройки. Дальше идут три шага. Из видео вынимается звуковая дорожка, модель Gemini от Google распознаёт речь вместе с метками времени, реплики автоматически выстраиваются по порядку и склеиваются в готовый текст. Обработка идёт секунды, а не минуты, потому что дорожку готовит ffmpeg у нас на сервере, а не ваш процессор.
Ответ приходит одним сообщением. Его можно скопировать целиком, вычитать опечатки и дальше делать что угодно — выложить расшифровкой под роликом, разобрать интервью на цитаты, собрать заметки после совещания. Исходный файл остаётся в переписке рядом с текстом, так что через неделю понятно, откуда взялась расшифровка.
Что можно выбрать
| Настройка | Варианты | Что меняет |
|---|---|---|
| Язык | как в записи, русский, английский | на каком языке написан текст |
| Вид текста | сплошной, с тайм-кодами | есть ли в тексте метки времени |
Сплошной текст — это одно полотно без разметки, его удобно сразу править и нести в пост или статью. Второй вид приходит блоком, где у каждой реплики стоит время начала и конца, такие метки называют таймкодами. С ними быстрее найти нужный момент в исходнике. Одна реплика занимает не больше двух строк и не больше семи секунд, поэтому метки идут часто и попадают близко к словам.
Знаки препинания расставляет сама модель. Абзацы в сплошном тексте она не делит, так что длинную речь стоит перечитать и разбить по смыслу самому.
Язык переключается на самом распознавании. Русский и английский тут не отдельный прогон переводчика, а сразу нужный язык в ответе.
Какая запись подойдёт
До 3 минут и до 300 МБ. Обычный ролик с телефона проходит целиком, ужимать его заранее не нужно. Формат видео не важен, звук вынимается и из mp4, и из mov.
Аудио принимается так же — mp3, m4a, wav, голосовое из мессенджера. Картинка карточке не нужна, нужна звуковая дорожка. Если её в файле нет, загрузка честно отклоняется сразу, ещё до списания токенов.
Распознаётся именно речь. Музыку, шум и посторонние звуки нейросеть не описывает, а неразборчивое место пропускает, а не придумывает слово за говорящего. Чем чище звук, тем меньше придётся вычитывать.
Чем это отличается от сервисов транскрибации
Транскрибация — то же самое слово, только из профессионального жаргона, и на рынке им называют две разные работы. Одну делает нейросеть за минуту, вторую человек-наборщик за вечер и совсем другие деньги. Здесь текст готовит ИИ, поэтому ответ приходит сразу, пока вы не ушли со страницы.
Отдельные сервисы распознавания продают минуты пакетами или подпиской, и дальше начинается арифметика — сколько минут осталось, сгорят ли они к концу месяца, что будет при переходе на другой тариф. Здесь ничего такого нет. Вы платите за запуск, из общего баланса, и только когда действительно расшифровываете файл.
Бесплатного лимита у карточки тоже нет. Те, кто расшифровывает бесплатно, обычно берут своё чем-то другим — лимитом на длину, очередью или обязательной регистрацией через чужой аккаунт.
Что карточка не делает
Ссылки карточка не принимает. Адрес с ютуба, вк или рутуба сюда вставлять некуда, чужое видео по ссылке мы не скачиваем — вы загружаете свой файл с устройства. Конвертеры, которые просят ссылку, делают другую работу и отвечают за неё сами.
Запись длиннее трёх минут придётся разрезать на части. Лекцию на полтора часа за один запуск расшифровать не получится.
Говорящих карточка не размечает. Пометок вида «спикер 1» и «спикер 2» в тексте не будет, реплики идут подряд одним потоком. Если в разговоре спорят трое, разбирать, кто что сказал, придётся по смыслу.
Субтитры в кадре — это соседняя задача, не эта. И пересказа тут нет, приходит дословный текст, без сокращений и без выводов.
Чужая запись и права
Чужие записи без согласия говорящих расшифровывать не нужно.
Расшифровка не имеет юридической силы. Для суда, протокола или медицинской карты она не годится, там нужен человек.
Если в разговоре звучат чужие персональные данные, стоит взвесить это до загрузки файла.
Чем это отличается от соседних карточек
Субтитры к видео возвращают сам ролик с текстом, вжатым в кадр, а тут вы получаете только текст. Озвучка текста работает в обратную сторону, из текста делает голос. Распознать текст с картинки снимает буквы со снимка, а не из речи, и перевод текста тоже начинается с готового текста, а не с дорожки.
С двумя карточками расшифровка складывается в цепочку. Получили текст здесь — отдайте его дальше, чтобы конспект лекции собрал короткую выжимку с главными мыслями, а протокол встречи превратил разговор в решения и задачи. Обе работают из готового текста, и расшифровка как раз этот текст даёт.