ElevenLabs выпустила нейросети Eleven v4 и v4 Turbo: теперь ИИ выполняет режиссерские команды и клонирует голос за 10 секунд

Компания ElevenLabs представила новое поколение моделей синтеза речи — Eleven v4 и ее скоростную модификацию Eleven v4 Turbo. Обновленная архитектура кардинально меняет подход к машинной озвучке. Если раньше алгоритмы просто зачитывали текст, пытаясь самостоятельно угадать нужную интонацию, то теперь пользователь выступает в роли режиссера. Для создателей аудиокниг, разработчиков видеоигр и авторов контента это означает сокращение времени на бесконечные повторные генерации ради правильного дубля.
Главным нововведением стала система управления эмоциями через текстовые подсказки. На официальной странице релиза разработчики поясняют, что прямо в сценарий можно вставлять сценические ремарки в квадратных скобках: [whispers] (шепот), [shouting] (крик), [laughing] (смех), [sighs] (вздох) или [long pause] (длинная пауза). Модель не просто издает указанный звук, но и органично подстраивает весь темп и манеру речи под заданную эмоцию. Дополнительно алгоритм научился генерировать синхронные звуковые эффекты вместе с речью — например, звук захлопывающейся двери на фоне.
Склейка контекста для длинных текстов и 90 языков
Базовая Eleven v4 поддерживает работу с более чем 90 языками, включая русский и украинский, а также отлично справляется с многоголосыми диалогами.
Специально для издателей и авторов аудиокниг в рабочую среду добавили технологию склейки контекста (context stitching). Алгоритм решает давнюю проблему нейросетевой озвучки длинных форматов: он связывает отдельные сгенерированные фрагменты между собой, сохраняя единую интонацию, ритм и характер голоса диктора на протяжении всей многочасовой записи.
Процесс работы с кастомными голосами также стал проще. Для создания быстрой цифровой копии (Instant Voice Cloning) системе теперь достаточно скормить всего 10 секунд чистого исходного аудио. Кроме того, как указано в документации платформы, в четвертое поколение вернулась полноценная поддержка профессионального клонирования (Professional Voice Cloning) студийного качества, которой не было в третьей версии.
Introducing Eleven v4 and Eleven v4 Turbo, our fastest and most emotive voice models yet.
— ElevenLabs (@ElevenLabs) September 28, 2026
Ranked #1 by Artificial Analysis. pic.twitter.com/gm8nAUMaQL
Версия Turbo и естественный пинг для ИИ-агентов
Для бизнеса и разработчиков интерактивных сервисов выпустили Eleven v4 Turbo. Эта модель сохраняет функционал базовой версии, но экстремально оптимизирована для работы в реальном времени. Медианная задержка инференса (отклика нейросети) снижена до 100 мс, а до произнесения первого звука проходит не более 150 мс. Это критически важный показатель для голосовых ассистентов, служб поддержки и телефонных ботов — такая задержка не воспринимается человеческим ухом как пауза, что делает диалог с машиной максимально естественным.
Обе генеративные модели уже развернуты в инфраструктуре компании и доступны через интерфейсы ElevenCreative, ElevenAgents и по API. Протестировать функционал Eleven v4 можно на базовом бесплатном тарифе, в который включено 10 000 кредитов на генерацию в месяц.