Google представила Gemini 3.8 Flash TTS – ИИ создаёт голоса по описанию и воспроизводит их по короткому образцу

Google выпустила две новые модели синтеза речи – Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Компания называет их своими наиболее выразительными моделями генерации аудио: старшая версия рассчитана на сложную озвучку, актёрскую игру и создание персонажей, а Flash-Lite – на массовый дубляж, чтение текста и голосовых агентов.
Одной из главных возможностей Gemini 3.8 Flash TTS стал Generative Voice Design. Разработчик может обычным текстом описать необходимый голос – его возраст, тембр, манеру речи, акцент и характер исполнения – после чего система создаст новую голосовую персону.
Кроме того, Google открыла библиотеку из более чем 2000 готовых голосов, включая региональные варианты вроде мексиканского испанского, квебекского французского и шотландского английского.
Старшая модель поддерживает 130 языков, Flash-Lite – 101. Gemini 3.8 Flash TTS также умеет работать с региональными акцентами и диалектами и поддерживает фонетические подсказки IPA для сложного произношения. Характеристики модели опубликованы в официальной документации Gemini API.
Голос можно воспроизвести по короткой записи, но только с согласием владельца
Обе модели поддерживают Voice Replication – создание стабильного синтетического голоса по короткому аудиообразцу.
Для этого требуется 10–30 секунд чистой речи, а также отдельная запись того же человека с обязательной фразой о согласии на создание синтетической модели его голоса. Система проверяет соответствие двух записей до создания профиля.
Поэтому просто загрузить чужой ролик или фрагмент интервью и клонировать голос без участия его владельца штатными средствами Google нельзя.
После проверки голос можно сохранить под постоянным voice_id и повторно использовать в проектах. Для сценариев, где разработчик не хочет хранить голосовой профиль на серверах Google, предусмотрен и вариант с временным зашифрованным ключом. Подробные требования описаны на странице Voice Replication.
introducing Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, our most expressive audio generation models yet
— Google AI Studio (@GoogleAIStudio) September 23, 2026
these models enable creators, developers, and enterprises to create richer, more expressive audio experiences
try them via the Gemini API and in AI Studio:… pic.twitter.com/vV84ErmKY1
Озвучку можно режиссировать построчно
Gemini 3.8 Flash TTS позволяет задавать отдельные инструкции практически для каждой реплики – темп, эмоциональную окраску, интонацию, акцент и актёрскую подачу.
Модель понимает и встроенные события вроде смеха, вздоха или короткой паузы, а также естественные разговорные реакции. Поддерживаются сцены с двумя персонажами, где система должна сохранять разные голоса и естественную очередность реплик.
Google также заявляет улучшенную стабильность в длинных аудиозаписях – голос, тембр, громкость и акустическая среда должны меньше «плыть» на протяжении продолжительного диалога или повествования. Это особенно важно для аудиокниг и подкастов.
В будущем появится Voice Remixing – возможность брать существующий голос из библиотеки и отдельно менять его тембр, высоту, скорость или акцент текстовыми командами. Пока эта функция только анонсирована.
Google заявляет лидерство в отдельных голосовых бенчмарках
В официальном анонсе Google называет Gemini 3.8 Flash TTS своей наиболее выразительной TTS-моделью и приводит результаты нескольких тестов.
В Hume AI Voice Design Benchmark модель заняла первое место с 71,4 балла, а также показала лучший результат в оценке акцентов – 60,8 балла. Flash TTS и Flash-Lite заняли соответственно первое и второе места в Hume AI Overall Quality Index.
Эти результаты относятся к конкретным тестам и не означают абсолютного превосходства модели над всеми конкурентами во всех сценариях.
Для защиты от злоупотреблений каждое созданное Gemini Audio аудио получает невидимый водяной знак SynthID. При репликации голоса дополнительно используются проверка согласия и C2PA-метаданные.
Gemini 3.8 Flash TTS и Flash-Lite TTS уже доступны разработчикам через Gemini API и Google AI Studio. Старшая модель также появляется в Gemini Notebook, а Flash-Lite – в Google Vids. Репликация голосов через AI Studio пока недоступна в ряде регионов, включая ЕЭЗ, Великобританию, Швейцарию и Индию.