Alibaba представила Qwen3.8-LiveTranslate — ШІ перекладає мовлення в реальному часі та розрізняє співрозмовників

Команда Qwen з Alibaba представила Qwen3.8-LiveTranslate — нову модель для синхронного перекладу аудіо та відео в реальному часі. Система підтримує 60 мов, уміє розрізняти учасників розмови, враховувати попередній контекст і озвучувати переклад голосом, близьким за тембром до оригінального спікера.
За даними Qwen, середня затримка перекладу за метрикою LAAL знизилася з 2,8 до 2,3 секунди порівняно з попереднім поколінням. Це не означає гарантованої затримки рівно 2,3 секунди для будь-якого користувача: підсумковий час також залежить від з’єднання, буферизації та способу відтворення.
В основі моделі лежить нова архітектура Interleave. Замість класичної послідовності «розпізнавання мовлення → переклад → синтез голосу» система працює з аудіо та текстовою інформацією як з єдиною часовою послідовністю. Уже оброблений звук і створений переклад можуть повторно використовуватися з контексту, що, за твердженням розробників, водночас підвищує зв’язність перекладу та зменшує затримку.
ШІ розрізняє кількох мовців і зберігає їхні голоси
Одне з головних нововведень — розділення спікерів у реальному часі. Під час розмови кількох людей Qwen визначає, кому належить кожна репліка, і зберігає цю прив’язку в перекладі.
Під час голосового виведення модель також намагається відтворювати індивідуальний тембр кожного учасника. Така функція розрахована насамперед на наради, інтерв’ю, конференції та інші ситуації, де важливо розуміти не лише зміст розмови, а й те, хто саме говорить.
Qwen3.8-LiveTranslate може одночасно показувати оригінальну розшифровку та переклад, а довгий контекст допомагає системі точніше обробляти імена, спеціальні терміни та неоднозначні вирази, сенс яких стає зрозумілим лише з попередніх реплік.
Модель також приймає зображення разом з аудіо. У документації QwenCloud зазначено, що візуальна інформація — наприклад, текст на екрані, жести чи інші деталі відеопотоку — може використовуватися для уточнення перекладу.
阿里刚刚放出了下一代实时同声传译模型:Qwen3.8-LiveTranslate,字均延迟从2.8秒压到2.3秒,支持60种语言
— AIGCLINK (@aigclink) September 19, 2026
如果延迟稳定压到2.3秒这个水平,并且在多说话人、长音频场景下DER可控,那会议、展会、跨境电商谈判等大量这种“够用就行”的场景可能会率先被AI接管… https://t.co/Ih3oPNDO3H pic.twitter.com/3ztVv4yLuZ
Голосовий переклад доступний не для всіх 60 мов
Заявлені 60 мов стосуються розпізнавання мовлення та текстового перекладу. Синтез перекладеного голосу поки що підтримується для 29 мов. Повний список компанія наводить у документації QwenCloud.
Спробувати технологію можна через вебдемонстрацію LiveTranslate. Розробникам доступна модель qwen3.8-livetranslate-flash-realtime через API. Її контекстне вікно становить близько 53 тисяч токенів, а міжнародний тариф починається з $7,50 за мільйон вхідних аудіотокенів; синтез мовлення коштує $30 за мільйон вихідних аудіотокенів.
У власних тестах Alibaba нова версія обійшла Qwen3.5-LiveTranslate та інші системи за якістю перекладу, розпізнаванням мовлення, затримкою та роботою з кількома спікерами. Поки що це результати самої Qwen, тож реальну різницю з конкурентами ще належить оцінити в незалежних порівняннях.