Чт, 24 Сен
Главное в крипте за 23 сентября: Raiffeisen расширяет торговлю криптовалютами, CFTC предупредила о рисках prediction markets Крипто 23.09.2026 23:50
Apple выпустила watchOS 27.0.1: срочный патч устраняет внезапные перезагрузки Apple Watch Софт 23.09.2026 23:31
Google представила Gemini 3.8 Flash TTS – ИИ создаёт голоса по описанию и воспроизводит их по короткому образцу Нейросети 23.09.2026 23:17
Logitech представила Yeti 2: культовый USB-микрофон получил 3D-датчик голоса, цветной экран и встроенный ИИ Гаджеты 23.09.2026 23:05
A24 выпустила трейлер почти трёхчасового фильма об Элизабет Холмс и крахе Theranos Кино/Сериалы 23.09.2026 21:11
Lunar Veil 2.0 превратит Terraria в сюжетную RPG: 54 босса, 30 новых зон и пять вариантов финала Игры 23.09.2026 21:03
Microsoft подала патентную заявку на систему рекламы между игровыми событиями Игры 23.09.2026 20:49
Ухудшение способности справляться с бытовыми делами связали с двукратным риском смерти Наука 23.09.2026 20:45
Lexus в виде штопора и бублика: арт-группа MSCHF скрутила серийные кроссоверы в сюрреалистические скульптуры Автомобили 23.09.2026 20:37
Эмулятор PS5 запустил Astro’s Playroom с частотой до 60 FPS: почему это не значит скорый запуск GTA VI на ПК ИгрыСофт 23.09.2026 20:30
JoJo: Steel Ball Run возвращается 25 сентября – вышел новый опенинг «SPIN» Кино/Сериалы 23.09.2026 20:23

Google представила Gemini 3.8 Flash TTS – ИИ создаёт голоса по описанию и воспроизводит их по короткому образцу

Max Ivanov · 23.09.2026 23:17 · 3 минуты чтения

Google выпустила две новые модели синтеза речи – Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Компания называет их своими наиболее выразительными моделями генерации аудио: старшая версия рассчитана на сложную озвучку, актёрскую игру и создание персонажей, а Flash-Lite – на массовый дубляж, чтение текста и голосовых агентов.

Одной из главных возможностей Gemini 3.8 Flash TTS стал Generative Voice Design. Разработчик может обычным текстом описать необходимый голос – его возраст, тембр, манеру речи, акцент и характер исполнения – после чего система создаст новую голосовую персону.

Кроме того, Google открыла библиотеку из более чем 2000 готовых голосов, включая региональные варианты вроде мексиканского испанского, квебекского французского и шотландского английского.

Старшая модель поддерживает 130 языков, Flash-Lite – 101. Gemini 3.8 Flash TTS также умеет работать с региональными акцентами и диалектами и поддерживает фонетические подсказки IPA для сложного произношения. Характеристики модели опубликованы в официальной документации Gemini API.

Голос можно воспроизвести по короткой записи, но только с согласием владельца

Обе модели поддерживают Voice Replication – создание стабильного синтетического голоса по короткому аудиообразцу.

Для этого требуется 10–30 секунд чистой речи, а также отдельная запись того же человека с обязательной фразой о согласии на создание синтетической модели его голоса. Система проверяет соответствие двух записей до создания профиля.

Поэтому просто загрузить чужой ролик или фрагмент интервью и клонировать голос без участия его владельца штатными средствами Google нельзя.

После проверки голос можно сохранить под постоянным voice_id и повторно использовать в проектах. Для сценариев, где разработчик не хочет хранить голосовой профиль на серверах Google, предусмотрен и вариант с временным зашифрованным ключом. Подробные требования описаны на странице Voice Replication.

Озвучку можно режиссировать построчно

Gemini 3.8 Flash TTS позволяет задавать отдельные инструкции практически для каждой реплики – темп, эмоциональную окраску, интонацию, акцент и актёрскую подачу.

Модель понимает и встроенные события вроде смеха, вздоха или короткой паузы, а также естественные разговорные реакции. Поддерживаются сцены с двумя персонажами, где система должна сохранять разные голоса и естественную очередность реплик.

Google также заявляет улучшенную стабильность в длинных аудиозаписях – голос, тембр, громкость и акустическая среда должны меньше «плыть» на протяжении продолжительного диалога или повествования. Это особенно важно для аудиокниг и подкастов.

В будущем появится Voice Remixing – возможность брать существующий голос из библиотеки и отдельно менять его тембр, высоту, скорость или акцент текстовыми командами. Пока эта функция только анонсирована.

Google заявляет лидерство в отдельных голосовых бенчмарках

В официальном анонсе Google называет Gemini 3.8 Flash TTS своей наиболее выразительной TTS-моделью и приводит результаты нескольких тестов.

В Hume AI Voice Design Benchmark модель заняла первое место с 71,4 балла, а также показала лучший результат в оценке акцентов – 60,8 балла. Flash TTS и Flash-Lite заняли соответственно первое и второе места в Hume AI Overall Quality Index.

Эти результаты относятся к конкретным тестам и не означают абсолютного превосходства модели над всеми конкурентами во всех сценариях.

Для защиты от злоупотреблений каждое созданное Gemini Audio аудио получает невидимый водяной знак SynthID. При репликации голоса дополнительно используются проверка согласия и C2PA-метаданные.

Gemini 3.8 Flash TTS и Flash-Lite TTS уже доступны разработчикам через Gemini API и Google AI Studio. Старшая модель также появляется в Gemini Notebook, а Flash-Lite – в Google Vids. Репликация голосов через AI Studio пока недоступна в ряде регионов, включая ЕЭЗ, Великобританию, Швейцарию и Индию.

Нравится ВсёЗависло?

Добавьте нас в предпочитаемые источники Google, чтобы чаще видеть наши новости.

Добавь нас в свой Google

Поделиться

Оставить комментарий