Google представила Gemini 3.8 Flash TTS – ШІ створює голоси за описом і відтворює їх за коротким зразком

Google випустила дві нові моделі синтезу мовлення – Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS. Компанія називає їх своїми найвиразнішими моделями генерації аудіо: старша версія розрахована на складне озвучування, акторську гру та створення персонажів, а Flash-Lite – на масовий дубляж, читання тексту й голосових агентів.
Однією з головних можливостей Gemini 3.8 Flash TTS стала Generative Voice Design. Розробник може звичайним текстом описати потрібний голос – його вік, тембр, манеру мовлення, акцент і характер виконання – після чого система створить нову голосову персону.
Крім того, Google відкрила бібліотеку з понад 2000 готових голосів, зокрема регіональні варіанти, як-от мексиканська іспанська, квебекська французька та шотландська англійська.
Старша модель підтримує 130 мов, Flash-Lite – 101. Gemini 3.8 Flash TTS також уміє працювати з регіональними акцентами й діалектами та підтримує фонетичні підказки IPA для складних випадків вимови. Характеристики моделі опубліковано в офіційній документації Gemini API.
Голос можна відтворити за коротким записом, але лише за згодою власника
Обидві моделі підтримують Voice Replication – створення стабільного синтетичного голосу за коротким аудіозразком.
Для цього потрібно 10–30 секунд чистого мовлення, а також окремий запис тієї самої людини з обов’язковою фразою про згоду на створення синтетичної моделі її голосу. Система перевіряє відповідність двох записів, перш ніж створити профіль.
Тому просто завантажити чуже відео чи фрагмент інтерв’ю й клонувати голос без участі його власника стандартними засобами Google не вийде.
Після перевірки голос можна зберегти під постійним voice_id і повторно використовувати в проєктах. Для сценаріїв, де розробник не хоче зберігати голосовий профіль на серверах Google, передбачено й варіант із тимчасовим зашифрованим ключем. Докладні вимоги описано на сторінці Voice Replication.
introducing Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS, our most expressive audio generation models yet
— Google AI Studio (@GoogleAIStudio) September 23, 2026
these models enable creators, developers, and enterprises to create richer, more expressive audio experiences
try them via the Gemini API and in AI Studio:… pic.twitter.com/vV84ErmKY1
Озвучування можна режисувати рядок за рядком
Gemini 3.8 Flash TTS дозволяє задавати окремі інструкції практично для кожної репліки – темп, емоційне забарвлення, інтонацію, акцент і акторську подачу.
Модель розуміє і вбудовані події, як-от сміх, зітхання чи коротку паузу, а також природні розмовні реакції. Підтримуються сцени з двома персонажами, де система має зберігати різні голоси та природну черговість реплік.
Google також заявляє про покращену стабільність у довгих аудіозаписах – голос, тембр, гучність і акустичне середовище мають менше «пливти» протягом тривалого діалогу чи розповіді. Це особливо важливо для аудіокниг і подкастів.
Згодом з’явиться Voice Remixing – можливість брати наявний голос із бібліотеки й окремо змінювати його тембр, висоту, швидкість або акцент текстовими командами. Поки що цю функцію лише анонсовано.
Google заявляє про лідерство в окремих голосових бенчмарках
В офіційному анонсі Google називає Gemini 3.8 Flash TTS своєю найвиразнішою TTS-моделлю та наводить результати кількох тестів.
У Hume AI Voice Design Benchmark модель посіла перше місце з 71,4 бала, а також показала найкращий результат в оцінюванні акцентів – 60,8 бала. Flash TTS і Flash-Lite посіли відповідно перше й друге місця в Hume AI Overall Quality Index.
Ці результати стосуються конкретних тестів і не означають абсолютної переваги моделі над усіма конкурентами в усіх сценаріях.
Для захисту від зловживань кожне аудіо, створене Gemini Audio, отримує невидимий водяний знак SynthID. Під час реплікації голосу додатково використовуються перевірка згоди та метадані C2PA.
Gemini 3.8 Flash TTS і Flash-Lite TTS уже доступні розробникам через Gemini API і Google AI Studio. Старша модель також з’являється в Gemini Notebook, а Flash-Lite – у Google Vids. Реплікація голосів через AI Studio поки недоступна в низці регіонів, зокрема в ЄЕЗ, Великій Британії, Швейцарії та Індії.