Пт, 25 Вер
Повернення відкладається: Warner Bros. перенесла прем’єру «Ґремлінів 3» на осінь 2028 року Кіно/Серіали 24.09.2026 19:33
Meta представила VR Glasses — 100-грамову альтернативу Vision Pro за $1299 Гаджети 24.09.2026 19:29
Безкоштовний ремастер The Witcher 3: Wild Hunt вийде 29 вересня — з новим боєм, прокачкою та доповненнями Ігри 24.09.2026 18:55
ШІ-агент OpenAI отримав несанкціонований доступ до закритих файлів порталу Medicare в Австралії Нейромережі 24.09.2026 18:53
Піксельний дизайн, ШІ від Google і база від Twingo: Nissan представила компактний електромобіль Pixo Автомобілі 24.09.2026 18:47
DC випустила фінальний трейлер хорору «Глиноликий» — прем’єра 23 жовтня Кіно/Серіали 24.09.2026 18:34
У CS2 з’явився прихований тамагочі: гравці знайшли систему улюбленців із життєвим циклом у 140 днів Ігри 24.09.2026 18:31
Вийшов перший трейлер «Рея Ганна» — фантастичного нуару Бреда Берда, задуманого понад 30 років тому Кіно/Серіали 24.09.2026 18:25
Meta показала кишеньковий ШІ-гаджет Muse Charm: асистент з аватаром, який виконує дії за користувача ГаджетиНейромережі 24.09.2026 18:24
CONTROL Resonant уже вийшла – критики хвалять атмосферу і світ, але сперечаються про бойову систему Ігри 24.09.2026 18:10
Трейлер третього сезону «Ніхто цього не хоче»: герої з’їжджаються в продовженні хіта Netflix Кіно/Серіали 24.09.2026 18:06

Google представила Gemini 3.8 Flash TTS – ШІ створює голоси за описом і відтворює їх за коротким зразком

Max Ivanov · 23.09.2026 23:17 · 3 хвилини читання

Google випустила дві нові моделі синтезу мовлення – Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS. Компанія називає їх своїми найвиразнішими моделями генерації аудіо: старша версія розрахована на складне озвучування, акторську гру та створення персонажів, а Flash-Lite – на масовий дубляж, читання тексту й голосових агентів.

Однією з головних можливостей Gemini 3.8 Flash TTS стала Generative Voice Design. Розробник може звичайним текстом описати потрібний голос – його вік, тембр, манеру мовлення, акцент і характер виконання – після чого система створить нову голосову персону.

Крім того, Google відкрила бібліотеку з понад 2000 готових голосів, зокрема регіональні варіанти, як-от мексиканська іспанська, квебекська французька та шотландська англійська.

Старша модель підтримує 130 мов, Flash-Lite – 101. Gemini 3.8 Flash TTS також уміє працювати з регіональними акцентами й діалектами та підтримує фонетичні підказки IPA для складних випадків вимови. Характеристики моделі опубліковано в офіційній документації Gemini API.

Голос можна відтворити за коротким записом, але лише за згодою власника

Обидві моделі підтримують Voice Replication – створення стабільного синтетичного голосу за коротким аудіозразком.

Для цього потрібно 10–30 секунд чистого мовлення, а також окремий запис тієї самої людини з обов’язковою фразою про згоду на створення синтетичної моделі її голосу. Система перевіряє відповідність двох записів, перш ніж створити профіль.

Тому просто завантажити чуже відео чи фрагмент інтерв’ю й клонувати голос без участі його власника стандартними засобами Google не вийде.

Після перевірки голос можна зберегти під постійним voice_id і повторно використовувати в проєктах. Для сценаріїв, де розробник не хоче зберігати голосовий профіль на серверах Google, передбачено й варіант із тимчасовим зашифрованим ключем. Докладні вимоги описано на сторінці Voice Replication.

Озвучування можна режисувати рядок за рядком

Gemini 3.8 Flash TTS дозволяє задавати окремі інструкції практично для кожної репліки – темп, емоційне забарвлення, інтонацію, акцент і акторську подачу.

Модель розуміє і вбудовані події, як-от сміх, зітхання чи коротку паузу, а також природні розмовні реакції. Підтримуються сцени з двома персонажами, де система має зберігати різні голоси та природну черговість реплік.

Google також заявляє про покращену стабільність у довгих аудіозаписах – голос, тембр, гучність і акустичне середовище мають менше «пливти» протягом тривалого діалогу чи розповіді. Це особливо важливо для аудіокниг і подкастів.

Згодом з’явиться Voice Remixing – можливість брати наявний голос із бібліотеки й окремо змінювати його тембр, висоту, швидкість або акцент текстовими командами. Поки що цю функцію лише анонсовано.

Google заявляє про лідерство в окремих голосових бенчмарках

В офіційному анонсі Google називає Gemini 3.8 Flash TTS своєю найвиразнішою TTS-моделлю та наводить результати кількох тестів.

У Hume AI Voice Design Benchmark модель посіла перше місце з 71,4 бала, а також показала найкращий результат в оцінюванні акцентів – 60,8 бала. Flash TTS і Flash-Lite посіли відповідно перше й друге місця в Hume AI Overall Quality Index.

Ці результати стосуються конкретних тестів і не означають абсолютної переваги моделі над усіма конкурентами в усіх сценаріях.

Для захисту від зловживань кожне аудіо, створене Gemini Audio, отримує невидимий водяний знак SynthID. Під час реплікації голосу додатково використовуються перевірка згоди та метадані C2PA.

Gemini 3.8 Flash TTS і Flash-Lite TTS уже доступні розробникам через Gemini API і Google AI Studio. Старша модель також з’являється в Gemini Notebook, а Flash-Lite – у Google Vids. Реплікація голосів через AI Studio поки недоступна в низці регіонів, зокрема в ЄЕЗ, Великій Британії, Швейцарії та Індії.

Подобається ВсеЗависло?

Додайте нас до улюблених джерел Google, щоб частіше бачити наші новини.

Додай нас у свій Google

Поділитися

Залишити коментар