Google · озвучка

Gemini 2.5 Flash TTS API — озвучка текста через /v1/audio/speech

Озвучка текста реалистичным голосом (TTS). Цена за озвучку.

озвучка

Цены · в рублях

Генерация1 071,4275 ₽/1M токенов озвучки

Актуальный прайс всех моделей — на странице цен API.

Интеграция

Идентификатор для API

google/gemini-2.5-flash-preview-tts

Совместимо с OpenAI Python/JS SDK — поменяйте только base_url и подставьте этот идентификатор в model. Пошагово — в Quick start.

Через единый API

Переключение на другую модель — одна строка в коде.

Оплата за токены

Без подписок и минимального чека. Списания только по факту.

Рублёвый баланс

Прозрачные цены в рублях, без долларовых конвертаций.

Gemini 2.5 Flash Preview TTS — модель озвучки текста от Google. Через Trackly AI она доступна по OpenAI-совместимому эндпоинту /v1/audio/speech: привычные голоса alloy, coral, nova, форматы mp3, wav и pcm, оплата в рублях с российской карты, работает без VPN. Подходит для озвучки статей, роликов, уроков и голосовых ответов ботов.

Что умеет Gemini TTS и где она пригодится?

Модель превращает текст до 4096 символов в естественную речь; русский язык поддерживается. Голос задаётся OpenAI-именем — alloy, coral, echo, nova, onyx, shimmer маппятся на родные голоса Gemini (Puck, Kore, Charon, Aoede, Fenrir, Leda) — либо родным именем напрямую. Тон и подачу можно менять полем instructions: например, «читай как диктор новостей».

Типовые сценарии: аудиоверсии статей и постов, закадровый голос для роликов, озвучка уроков и курсов, голосовые ответы в ботах и IVR.

Как озвучить текст через API?

Формат OpenAI-совместимый: официальный SDK OpenAI, base_url = https://api.trackly.one/v1, ключ из личного кабинета:

with client.audio.speech.with_streaming_response.create(
    model="google/gemini-2.5-flash-preview-tts",
    voice="coral",
    input="Привет! Это тестовая озвучка текста.",
) as response:
    response.stream_to_file("speech.mp3")

Ответ — сразу бинарное аудио, не JSON: mp3 по умолчанию, response_format переключает на wav или pcm. Первый запрос — по Quick start, все поля и маппинг голосов — в гайде по озвучке. Списание — после успешного ответа по фактическому расходу; при ошибке провайдера списания нет.

Чем TTS-модель отличается от текстовых Gemini?

Gemini 2.5 Flash TTSGemini 2.5 Flash / Pro
Задачатекст → речьтекст и картинки → текст
Эндпоинт/v1/audio/speech/v1/chat/completions
Ответбинарное аудио: mp3, wav, pcmJSON или SSE-стрим
Диалог и контекстнет: один запрос — одна озвучкада: история сообщений

Текст для озвучки удобно готовить «текстовыми сёстрами» линейки: черновик и сокращение — быстрый Gemini 2.5 Flash, сложный сценарий — Gemini 2.5 Pro, а готовый результат отдавать в TTS.

Что модель делает плохо?

  • Лимит входа — 4096 символов: длинный текст придётся резать на части и склеивать аудио на своей стороне.
  • Параметр speed работает приблизительно: у Gemini нет жёсткого множителя скорости, значение передаётся модели голосовой инструкцией «говори быстрее или медленнее».
  • Распознавать речь модель не умеет — только синтез, обратной задачи (STT) в каталоге пока нет.
  • Это preview-версия Google: список голосов и нюансы интонаций могут меняться со временем.

Кому подойдёт эта модель?

Если нужна озвучка через API с оплатой в рублях и без VPN — это основная TTS-модель нашего каталога. Стоимость запроса видна в калькуляторе выше, тарифы всех моделей — на странице цен. Послушать голоса без кода и подобрать подходящий можно в озвучке на сайте.

Вопросы и ответы

Совместима ли озвучка с OpenAI SDK?+

Да. Эндпоинт /v1/audio/speech повторяет контракт OpenAI: в официальном SDK меняете base_url на api.trackly.one/v1, подставляете ключ Trackly и вызываете audio.speech.create с моделью google/gemini-2.5-flash-preview-tts. Ответ приходит бинарным аудио-телом, как у OpenAI.

Какие голоса поддерживает Gemini TTS через API?+

Принимаются OpenAI-имена alloy, coral, echo, nova, onyx и shimmer — они маппятся на родные голоса Gemini: Puck, Kore, Charon, Aoede, Fenrir и Leda. Родные имена Gemini тоже можно передавать напрямую. Неизвестное или пустое имя не роняет запрос — подставится дефолтный голос Kore.

Какой лимит на длину текста?+

До 4096 символов на один запрос — как у OpenAI. Более длинный материал нужно разбить на части, озвучить каждую отдельным запросом и склеить дорожки на своей стороне. Абзацы — удобная граница нарезки: интонация на стыках звучит естественнее.

Как списываются деньги за озвучку?+

После успешного ответа, по фактическому расходу, который вернул провайдер, — как у текстовых моделей. Если провайдер не отдал usage, расход оценивается по длине входного текста. При ошибке провайдера списания не происходит: платите только за реально полученное аудио.

Обновлено 13 июля 2026 г.

Попробуйте gemini-2.5-flash-preview-tts

Зарегистрируйтесь, пополните баланс и сделайте первый запрос за пять минут.