Gemini-3.1-flash-tts
Характеристики модели
Разработчик: Google
Языковая модель: Gemini
Название от разработчика: gemini-3.1-flash-tts-preview
Дата выхода: апрель, 2026
Тип модели: для генерации аудио
Контекст: 8К
Статус: активная
Доступно в API: Да
Модальности и цены
На ввод (в запросе пользователя) модель может принимать:
На выводе модель выдает:
Цены указаны за 1000 токенов / 1 cекунду аудио (зависит от модели). В среднем 25 токенов требуется для генерации 1 секунды аудио.
Поддержка файлов
Отправка файлов не поддерживается
Поддержка функций
Размышление: нет
Веб-поиск: нет
Генерация аудио
Голос озвучки:
Скорость:
Формат:
Описание модели
Gemini 3.1 Flash TTS — это специализированная модель преобразования текста в речь от Google DeepMind, предназначенная для создания естественного, выразительного и управляемого аудио. Модель доступна в предварительной версии под идентификатором gemini-3.1-flash-tts-preview и ориентирована на приложения, которым требуется качественная синтезированная речь с низкой задержкой.
Gemini 3.1 Flash TTS поддерживает более 70 языков и позволяет управлять манерой произношения с помощью текстовых инструкций и специальных аудиотегов. Разработчик может задавать темп, тон, эмоциональную окраску, акцент и особенности подачи речи, превращая обычный текст в более выразительную голосовую композицию.
Одной из главных особенностей модели является сочетание качества синтеза и детального управления исполнением. Вместо простой механической озвучки текста Gemini 3.1 Flash TTS позволяет формировать полноценную голосовую подачу с различными стилями, темпом и эмоциональными характеристиками.
Модель поддерживает генерацию речи с несколькими участниками диалога. Это позволяет создавать естественные разговорные сцены, подкасты, диалоги виртуальных персонажей и другие виды аудиоконтента, в которых требуется несколько голосов.
Ключевые особенности Gemini 3.1 Flash TTS
Выразительная генерация речи
Gemini 3.1 Flash TTS разработана для создания естественной и выразительной речи. Модель позволяет управлять не только содержанием текста, но и тем, как именно он должен быть произнесён.
- Естественное звучание: Улучшенная передача интонации и особенностей человеческой речи.
- Управление темпом: Возможность задавать скорость и ритм произношения.
- Эмоциональная подача: Управление настроением и характером исполнения.
- Стилевые инструкции: Использование текстовых указаний для изменения манеры речи.
Аудиотеги
Одно из главных нововведений Gemini 3.1 Flash TTS — специальные audio tags, которые позволяют более точно управлять исполнением. Инструкции можно добавлять непосредственно в текстовый запрос, задавая характеристики голоса и его подачи.
Аудиотеги позволяют управлять такими параметрами, как темп, тональность, стиль и эмоциональная выразительность. При этом настройки могут изменяться непосредственно в ходе текста, позволяя создавать более динамичное исполнение.
Диалоги с несколькими голосами
Gemini 3.1 Flash TTS поддерживает нативную генерацию речи для нескольких участников. Это позволяет создавать диалоги без необходимости отдельно генерировать каждую реплику и затем объединять аудиофайлы.
- Диалоги виртуальных персонажей.
- Подкасты и разговорные форматы.
- Интерактивные истории.
- Образовательные материалы.
- Сценарии с несколькими дикторами.
Более 70 языков
Модель поддерживает генерацию речи более чем на 70 языках, что делает её подходящей для создания мультиязычных приложений и локализованного аудиоконтента.
Низкая задержка и потоковая генерация
Gemini 3.1 Flash TTS ориентирована на сценарии, где важна скорость получения аудио. Для этой модели также предусмотрена поддержка потоковой генерации речи, что позволяет получать аудиоданные по мере их создания.
Настройка голосов
В Google AI Studio разработчики могут экспериментировать с голосами и параметрами их подачи. После выбора подходящей конфигурации настройки можно использовать повторно для сохранения более последовательного звучания персонажей и проектов.
Применение Gemini 3.1 Flash TTS
Для голосовых ассистентов: Модель позволяет создавать естественные голосовые ответы с управляемой интонацией и темпом речи.
Для видео: Подходит для озвучки роликов, презентаций, рекламных материалов и цифровых персонажей.
Для образования: Может использоваться для создания мультиязычных учебных материалов, лекций, интерактивных упражнений и аудиокурсов.
Для подкастов: Поддержка нескольких голосов позволяет создавать диалоговые аудиоформаты и экспериментировать с виртуальными ведущими.
Для игр: Модель может использоваться для озвучивания игровых персонажей, диалогов и интерактивных сценариев.
Для интерактивных приложений: Низкая задержка и возможность управлять стилем речи делают модель подходящей для сервисов, где пользователю требуется быстро получать естественный голосовой ответ.
Ограничения
Gemini 3.1 Flash TTS предназначена именно для синтеза речи: она принимает текстовые входные данные и генерирует аудио. Качество и стабильность длинных записей могут постепенно снижаться при генерации продолжительных материалов, поэтому большие тексты рекомендуется разбивать на отдельные фрагменты.
Кроме того, соответствие голоса заданным инструкциям не всегда бывает абсолютным. Для получения более предсказуемого результата рекомендуется согласовывать описание персонажа, стиль текста и выбранный голос.
Gemini 3.1 Flash TTS особенно хорошо подходит для приложений, которым необходимо сочетать естественное звучание, низкую задержку, управление стилем речи и мультиязычность. Благодаря аудиотегам и поддержке нескольких голосов модель позволяет создавать не просто озвучку текста, а полноценные управляемые голосовые сцены.