Пт, 25 Вер
Ідеальний Porsche 959 від фанатів: Mattel випустила колекційну Hot Wheels за заявками спільноти Автомобілі 25.09.2026 17:16
Оригінальна Gothic уперше вийшла на iPhone та iPad — без урізаного контенту й мікротранзакцій Ігри 25.09.2026 17:11
Перший трейлер Day Drinker: Джонні Депп і Пенелопа Крус у кримінальному трилері від творців «Джона Віка» Кіно/Серіали 25.09.2026 17:09
З’явилися повідомлення про можливий злам Bitget – з гаманців могли вивести понад $170 млн Крипто 25.09.2026 00:03
Brabus перетворила Mercedes-AMG G 63 на 900-сильний кабріолет Автомобілі 24.09.2026 20:07
Rockstar відкрила передзамовлення на колекційний набір за $400 до GTA VI — самої гри в ньому немає Ігри 24.09.2026 20:04
GPT-4, Llama, Gemma і Mistral по-різному реагують на «чоловічий» і «жіночий» стиль запитів Нейромережі 24.09.2026 20:01
Для фанатів «Гаррі Поттера»: realme випустила спецверсію смартфона 16 Pro 5G з гербом Гоґвортсу, що змінює колір Гаджети 24.09.2026 19:53
Bentley представила перший електромобіль – 888 к.с., до 600 км запасу ходу та заряджання за 16 хвилин Автомобілі 24.09.2026 19:49
ШІ-агенти Claude самостійно відкрили нову систему в ДНК вірусів, схожу на CRISPR НаукаНейромережі 24.09.2026 19:44
Xiaomi повернула «прозрачні» смартфони через шість років – представлено особливі Xiaomi 18 Pro і Pro Max Гаджети 24.09.2026 19:39

Google представила Gemini 3.8 Flash TTS – ШІ створює голоси за описом і відтворює їх за коротким зразком

Max Ivanov · 23.09.2026 23:17 · 3 хвилини читання

Google випустила дві нові моделі синтезу мовлення – Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS. Компанія називає їх своїми найвиразнішими моделями генерації аудіо: старша версія розрахована на складне озвучування, акторську гру та створення персонажів, а Flash-Lite – на масовий дубляж, читання тексту й голосових агентів.

Однією з головних можливостей Gemini 3.8 Flash TTS стала Generative Voice Design. Розробник може звичайним текстом описати потрібний голос – його вік, тембр, манеру мовлення, акцент і характер виконання – після чого система створить нову голосову персону.

Крім того, Google відкрила бібліотеку з понад 2000 готових голосів, зокрема регіональні варіанти, як-от мексиканська іспанська, квебекська французька та шотландська англійська.

Старша модель підтримує 130 мов, Flash-Lite – 101. Gemini 3.8 Flash TTS також уміє працювати з регіональними акцентами й діалектами та підтримує фонетичні підказки IPA для складних випадків вимови. Характеристики моделі опубліковано в офіційній документації Gemini API.

Голос можна відтворити за коротким записом, але лише за згодою власника

Обидві моделі підтримують Voice Replication – створення стабільного синтетичного голосу за коротким аудіозразком.

Для цього потрібно 10–30 секунд чистого мовлення, а також окремий запис тієї самої людини з обов’язковою фразою про згоду на створення синтетичної моделі її голосу. Система перевіряє відповідність двох записів, перш ніж створити профіль.

Тому просто завантажити чуже відео чи фрагмент інтерв’ю й клонувати голос без участі його власника стандартними засобами Google не вийде.

Після перевірки голос можна зберегти під постійним voice_id і повторно використовувати в проєктах. Для сценаріїв, де розробник не хоче зберігати голосовий профіль на серверах Google, передбачено й варіант із тимчасовим зашифрованим ключем. Докладні вимоги описано на сторінці Voice Replication.

Озвучування можна режисувати рядок за рядком

Gemini 3.8 Flash TTS дозволяє задавати окремі інструкції практично для кожної репліки – темп, емоційне забарвлення, інтонацію, акцент і акторську подачу.

Модель розуміє і вбудовані події, як-от сміх, зітхання чи коротку паузу, а також природні розмовні реакції. Підтримуються сцени з двома персонажами, де система має зберігати різні голоси та природну черговість реплік.

Google також заявляє про покращену стабільність у довгих аудіозаписах – голос, тембр, гучність і акустичне середовище мають менше «пливти» протягом тривалого діалогу чи розповіді. Це особливо важливо для аудіокниг і подкастів.

Згодом з’явиться Voice Remixing – можливість брати наявний голос із бібліотеки й окремо змінювати його тембр, висоту, швидкість або акцент текстовими командами. Поки що цю функцію лише анонсовано.

Google заявляє про лідерство в окремих голосових бенчмарках

В офіційному анонсі Google називає Gemini 3.8 Flash TTS своєю найвиразнішою TTS-моделлю та наводить результати кількох тестів.

У Hume AI Voice Design Benchmark модель посіла перше місце з 71,4 бала, а також показала найкращий результат в оцінюванні акцентів – 60,8 бала. Flash TTS і Flash-Lite посіли відповідно перше й друге місця в Hume AI Overall Quality Index.

Ці результати стосуються конкретних тестів і не означають абсолютної переваги моделі над усіма конкурентами в усіх сценаріях.

Для захисту від зловживань кожне аудіо, створене Gemini Audio, отримує невидимий водяний знак SynthID. Під час реплікації голосу додатково використовуються перевірка згоди та метадані C2PA.

Gemini 3.8 Flash TTS і Flash-Lite TTS уже доступні розробникам через Gemini API і Google AI Studio. Старша модель також з’являється в Gemini Notebook, а Flash-Lite – у Google Vids. Реплікація голосів через AI Studio поки недоступна в низці регіонів, зокрема в ЄЕЗ, Великій Британії, Швейцарії та Індії.

Подобається ВсеЗависло?

Додайте нас до улюблених джерел Google, щоб частіше бачити наші новини.

Додай нас у свій Google

Поділитися

Залишити коментар