Gemini-2.5-flash-tts
Характеристики модели
Разработчик: Google
Языковая модель: Gemini
Название от разработчика: gemini-2.5-flash-preview-tts
Дата выхода: май, 2025
Тип модели: для генерации аудио
Контекст: 8К
Статус: активная
Доступно в API: Да
Модальности и цены
На ввод (в запросе пользователя) модель может принимать:
На выводе модель выдает:
Цены указаны за 1000 токенов / 1 cекунду аудио (зависит от модели). В среднем 25 токенов требуется для генерации 1 секунды аудио.
Поддержка файлов
Отправка файлов не поддерживается
Поддержка функций
Размышление: нет
Веб-поиск: нет
Генерация аудио
Голос озвучки:
Скорость:
Формат:
Описание модели
Gemini 2.5 Flash TTS — это специализированная модель синтеза речи от Google, предназначенная для преобразования текста в естественно звучащую речь. Она ориентирована на сценарии, где важны качество аудио, выразительность и возможность управлять характеристиками голосовой подачи.
Модель позволяет создавать речь с различной интонацией, темпом и эмоциональной окраской в зависимости от содержания и заданных инструкций. Gemini 2.5 Flash TTS подходит как для коротких голосовых ответов, так и для создания более продолжительного аудиоконтента.
Благодаря ориентации на быстрый синтез модель может использоваться в интерактивных приложениях и сервисах, где голос является частью пользовательского интерфейса. Она также подходит для автоматической озвучки текстов, цифровых персонажей и мультимедийного контента.
Применение Gemini 2.5 Flash TTS
Для голосовых ассистентов: Создание естественных голосовых ответов и интерактивного общения с пользователями.
Для видео и медиаконтента: Озвучка роликов, презентаций, рекламных материалов и цифровых персонажей.
Для образования: Создание аудиоверсий учебных материалов, объяснений и других образовательных текстов.
Для приложений: Интеграция синтеза речи в сервисы, интерфейсы и автоматизированные системы.