ElevenLabs випустила нейромережі Eleven v4 і v4 Turbo: тепер ШІ виконує режисерські команди та клонує голос за 10 секунд

Компанія ElevenLabs представила нове покоління моделей синтезу мовлення — Eleven v4 та її швидкісну модифікацію Eleven v4 Turbo. Оновлена архітектура докорінно змінює підхід до машинного озвучування. Якщо раніше алгоритми просто зачитували текст, намагаючись самостійно вгадати потрібну інтонацію, то тепер користувач виступає в ролі режисера. Для творців аудіокниг, розробників відеоігор та авторів контенту це означає скорочення часу на нескінченні повторні генерації заради правильного дубля.
Головним нововведенням стала система керування емоціями через текстові підказки. На офіційній сторінці релізу розробники пояснюють, що прямо в сценарій можна вставляти сценічні ремарки в квадратних дужках: [whispers] (шепіт), [shouting] (крик), [laughing] (сміх), [sighs] (зітхання) або [long pause] (довга пауза). Модель не просто видає вказаний звук, а й органічно підлаштовує весь темп і манеру мовлення під задану емоцію. Додатково алгоритм навчився генерувати синхронні звукові ефекти разом із мовленням — наприклад, звук дверей, що зачиняються, на тлі.
Зшивання контексту для довгих текстів і 90 мов
Базова Eleven v4 підтримує роботу з понад 90 мовами, зокрема російською та українською, а також добре дає раду багатоголосим діалогам.
Спеціально для видавців і авторів аудіокниг у робоче середовище додали технологію зшивання контексту (context stitching). Алгоритм розв’язує давню проблему нейромережевого озвучування довгих форматів: він пов’язує окремі згенеровані фрагменти між собою, зберігаючи єдину інтонацію, ритм і характер голосу диктора протягом усього багатогодинного запису.
Процес роботи з кастомними голосами також став простішим. Для створення швидкої цифрової копії (Instant Voice Cloning) системі тепер достатньо згодувати всього 10 секунд чистого вихідного аудіо. Крім того, як зазначено в документації платформи, у четверте покоління повернулася повноцінна підтримка професійного клонування (Professional Voice Cloning) студійної якості, якої не було в третій версії.
Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet.
— ElevenLabs (@ElevenLabs) September 28, 2026
Ranked #1 by Artificial Analysis. pic.twitter.com/gm8nAUMaQL
Версія Turbo та природний пінг для ШІ-агентів
Для бізнесу та розробників інтерактивних сервісів випустили Eleven v4 Turbo. Ця модель зберігає функціонал базової версії, але екстремально оптимізована для роботи в реальному часі. Медіанну затримку інференсу (відгуку нейромережі) знижено до 100 мс, а до вимовляння першого звуку минає не більше 150 мс. Це критично важливий показник для голосових асистентів, служб підтримки та телефонних ботів — така затримка не сприймається людським вухом як пауза, що робить діалог із машиною максимально природним.
Обидві генеративні моделі вже розгорнуті в інфраструктурі компанії та доступні через інтерфейси ElevenCreative, ElevenAgents і за API. Протестувати функціонал Eleven v4 можна на базовому безкоштовному тарифі, до якого включено 10 000 кредитів на генерацію на місяць.