Alibaba представила Qwen3.8-LiveTranslate — ИИ переводит речь в реальном времени и различает собеседников

Команда Qwen из Alibaba представила Qwen3.8-LiveTranslate — новую модель для синхронного перевода аудио и видео в реальном времени. Система поддерживает 60 языков, умеет различать участников разговора, учитывать предыдущий контекст и озвучивать перевод голосом, близким по тембру к оригинальному спикеру.
По данным Qwen, средняя задержка перевода по метрике LAAL снизилась с 2,8 до 2,3 секунды по сравнению с предыдущим поколением. Это не означает гарантированную задержку ровно 2,3 секунды для любого пользователя: итоговое время также зависит от соединения, буферизации и способа воспроизведения.
В основе модели лежит новая архитектура Interleave. Вместо классической последовательности «распознавание речи → перевод → синтез голоса» система работает с аудио и текстовой информацией как с единой временной последовательностью. Уже обработанный звук и созданный перевод могут повторно использоваться из контекста, что, по утверждению разработчиков, одновременно повышает связность перевода и уменьшает задержку.
ИИ различает нескольких говорящих и сохраняет их голоса
Одно из главных нововведений — разделение спикеров в реальном времени. Во время разговора нескольких людей Qwen определяет, кому принадлежит каждая реплика, и сохраняет эту привязку в переводе.
При голосовом выводе модель также старается воспроизводить индивидуальный тембр каждого участника. Такая функция рассчитана прежде всего на совещания, интервью, конференции и другие ситуации, где важно понимать не только содержание разговора, но и кто именно говорит.
Qwen3.8-LiveTranslate может одновременно показывать оригинальную расшифровку и перевод, а длинный контекст помогает системе точнее обрабатывать имена, специальные термины и неоднозначные выражения, смысл которых становится понятен только из предыдущих реплик.
Модель также принимает изображения вместе с аудио. В документации QwenCloud говорится, что визуальная информация — например, текст на экране, жесты или другие детали видеопотока — может использоваться для уточнения перевода.
阿里刚刚放出了下一代实时同声传译模型:Qwen3.8-LiveTranslate,字均延迟从2.8秒压到2.3秒,支持60种语言
— AIGCLINK (@aigclink) September 19, 2026
如果延迟稳定压到2.3秒这个水平,并且在多说话人、长音频场景下DER可控,那会议、展会、跨境电商谈判等大量这种“够用就行”的场景可能会率先被AI接管… https://t.co/Ih3oPNDO3H pic.twitter.com/3ztVv4yLuZ
Голосовой перевод доступен не для всех 60 языков
Заявленные 60 языков относятся к распознаванию речи и текстовому переводу. Синтез переведённого голоса пока поддерживается для 29 языков. Полный список компания приводит в документации QwenCloud.
Попробовать технологию можно через веб-демонстрацию LiveTranslate. Для разработчиков доступна модель qwen3.8-livetranslate-flash-realtime через API. Её контекстное окно составляет около 53 тысяч токенов, а международный тариф начинается с $7,50 за миллион входных аудиотокенов; синтез речи стоит $30 за миллион выходных аудиотокенов.
В собственных тестах Alibaba новая версия обошла Qwen3.5-LiveTranslate и другие системы по качеству перевода, распознаванию речи, задержке и работе с несколькими спикерами. Пока это результаты самой Qwen, поэтому реальную разницу с конкурентами ещё предстоит оценить в независимых сравнениях.