Google · озвучка
Gemini 2.5 Flash TTS API — озвучка текста через /v1/audio/speech
Озвучка текста реалистичным голосом (TTS). Цена за озвучку.
Цены · в рублях
Актуальный прайс всех моделей — на странице цен API.
Интеграция
Идентификатор для API
google/gemini-2.5-flash-preview-ttsСовместимо с OpenAI Python/JS SDK — поменяйте только base_url и подставьте этот идентификатор в model. Пошагово — в Quick start.
Через единый API
Переключение на другую модель — одна строка в коде.
Оплата за токены
Без подписок и минимального чека. Списания только по факту.
Рублёвый баланс
Прозрачные цены в рублях, без долларовых конвертаций.
Gemini 2.5 Flash Preview TTS — модель озвучки текста от Google. Через Trackly AI она доступна по OpenAI-совместимому эндпоинту /v1/audio/speech: привычные голоса alloy, coral, nova, форматы mp3, wav и pcm, оплата в рублях с российской карты, работает без VPN. Подходит для озвучки статей, роликов, уроков и голосовых ответов ботов.
Что умеет Gemini TTS и где она пригодится?
Модель превращает текст до 4096 символов в естественную речь; русский язык поддерживается. Голос задаётся OpenAI-именем — alloy, coral, echo, nova, onyx, shimmer маппятся на родные голоса Gemini (Puck, Kore, Charon, Aoede, Fenrir, Leda) — либо родным именем напрямую. Тон и подачу можно менять полем instructions: например, «читай как диктор новостей».
Типовые сценарии: аудиоверсии статей и постов, закадровый голос для роликов, озвучка уроков и курсов, голосовые ответы в ботах и IVR.
Как озвучить текст через API?
Формат OpenAI-совместимый: официальный SDK OpenAI, base_url = https://api.trackly.one/v1, ключ из личного кабинета:
with client.audio.speech.with_streaming_response.create(
model="google/gemini-2.5-flash-preview-tts",
voice="coral",
input="Привет! Это тестовая озвучка текста.",
) as response:
response.stream_to_file("speech.mp3")
Ответ — сразу бинарное аудио, не JSON: mp3 по умолчанию, response_format переключает на wav или pcm. Первый запрос — по Quick start, все поля и маппинг голосов — в гайде по озвучке. Списание — после успешного ответа по фактическому расходу; при ошибке провайдера списания нет.
Чем TTS-модель отличается от текстовых Gemini?
| Gemini 2.5 Flash TTS | Gemini 2.5 Flash / Pro | |
|---|---|---|
| Задача | текст → речь | текст и картинки → текст |
| Эндпоинт | /v1/audio/speech | /v1/chat/completions |
| Ответ | бинарное аудио: mp3, wav, pcm | JSON или SSE-стрим |
| Диалог и контекст | нет: один запрос — одна озвучка | да: история сообщений |
Текст для озвучки удобно готовить «текстовыми сёстрами» линейки: черновик и сокращение — быстрый Gemini 2.5 Flash, сложный сценарий — Gemini 2.5 Pro, а готовый результат отдавать в TTS.
Что модель делает плохо?
- Лимит входа — 4096 символов: длинный текст придётся резать на части и склеивать аудио на своей стороне.
- Параметр
speedработает приблизительно: у Gemini нет жёсткого множителя скорости, значение передаётся модели голосовой инструкцией «говори быстрее или медленнее». - Распознавать речь модель не умеет — только синтез, обратной задачи (STT) в каталоге пока нет.
- Это preview-версия Google: список голосов и нюансы интонаций могут меняться со временем.
Кому подойдёт эта модель?
Если нужна озвучка через API с оплатой в рублях и без VPN — это основная TTS-модель нашего каталога. Стоимость запроса видна в калькуляторе выше, тарифы всех моделей — на странице цен. Послушать голоса без кода и подобрать подходящий можно в озвучке на сайте.
Вопросы и ответы
Совместима ли озвучка с OpenAI SDK?+
Да. Эндпоинт /v1/audio/speech повторяет контракт OpenAI: в официальном SDK меняете base_url на api.trackly.one/v1, подставляете ключ Trackly и вызываете audio.speech.create с моделью google/gemini-2.5-flash-preview-tts. Ответ приходит бинарным аудио-телом, как у OpenAI.
Какие голоса поддерживает Gemini TTS через API?+
Принимаются OpenAI-имена alloy, coral, echo, nova, onyx и shimmer — они маппятся на родные голоса Gemini: Puck, Kore, Charon, Aoede, Fenrir и Leda. Родные имена Gemini тоже можно передавать напрямую. Неизвестное или пустое имя не роняет запрос — подставится дефолтный голос Kore.
Какой лимит на длину текста?+
До 4096 символов на один запрос — как у OpenAI. Более длинный материал нужно разбить на части, озвучить каждую отдельным запросом и склеить дорожки на своей стороне. Абзацы — удобная граница нарезки: интонация на стыках звучит естественнее.
Как списываются деньги за озвучку?+
После успешного ответа, по фактическому расходу, который вернул провайдер, — как у текстовых моделей. Если провайдер не отдал usage, расход оценивается по длине входного текста. При ошибке провайдера списания не происходит: платите только за реально полученное аудио.
Обновлено 13 июля 2026 г.
Попробуйте gemini-2.5-flash-preview-tts
Зарегистрируйтесь, пополните баланс и сделайте первый запрос за пять минут.