Gemini-2.5-pro-tts
Характеристики модели
Разработчик: Google
Языковая модель: Gemini
Название от разработчика: gemini-2.5-pro-preview-tts
Дата выхода: май, 2025
Тип модели: для генерации аудио
Контекст: 8К
Статус: активная
Доступно в API: Да
Модальности и цены
На ввод (в запросе пользователя) модель может принимать:
На выводе модель выдает:
Цены указаны за 1000 токенов / 1 cекунду аудио (зависит от модели). В среднем 25 токенов требуется для генерации 1 секунды аудио.
Поддержка файлов
Отправка файлов не поддерживается
Поддержка функций
Размышление: нет
Веб-поиск: нет
Генерация аудио
Голос озвучки:
Скорость:
Формат:
Описание модели
Gemini 2.5 Pro TTS — модель синтеза речи от Google, ориентированная на высокое качество, естественную интонацию и выразительную озвучку. В Gemini API она доступна как gemini-2.5-pro-preview-tts, а в Google Cloud Text-to-Speech — как Gemini 2.5 Pro TTS. Google позиционирует модель прежде всего для длинного контента, профессиональной дикторской озвучки и сложных творческих сценариев.
Модель подходит для аудиокниг, подкастов, образовательных материалов, презентаций, видео и другого контента, где важны естественная речь, точная передача интонации и возможность управлять стилем, темпом, акцентом и эмоциональной подачей с помощью текстовых инструкций. Gemini 2.5 Pro TTS поддерживает как озвучку одним диктором, так и диалоги с несколькими дикторами.
Применение Gemini 2.5 Pro TTS
Для аудиокниг: Подходит для продолжительной озвучки и длинных повествовательных материалов, где важны естественная речь и выразительная подача.
Для видео: Позволяет создавать закадровую озвучку и дикторские дорожки с управляемым темпом, стилем и интонацией.
Для образования: Может использоваться для создания аудиокурсов, лекций, учебных материалов и других образовательных проектов.
Для подкастов и медиа: Подходит для подкастов, диалоговых сцен, рекламных и других аудиоматериалов, в которых требуется естественная и выразительная речь.