Нд, 20 Вер
У романтичних пар музичні смаки збігаються частіше, ніж риси характеру Наука 19.09.2026 23:27
Alibaba представила Qwen3.8-LiveTranslate — ШІ перекладає мовлення в реальному часі та розрізняє співрозмовників Нейромережі 19.09.2026 23:18
Онлайн ARC Raiders продовжує падати — велике оновлення Frozen Trail вийде 8 жовтня Ігри 19.09.2026 22:48
Tesla планує почати продажі роботів Optimus у другій половині 2027 року Технології 19.09.2026 16:58
Алан Рітчсон може зіграти головну роль в екранізації Helldivers ІгриКіно/Серіали 19.09.2026 16:55
Ferrari представила 296 GT Modificata — 730-сильний трековий суперкар без обмежень гоночного регламенту Автомобілі 19.09.2026 16:50
CNN: помилковий ШІ-аналіз мало не призвів до військової операції США проти китайського судна Нейромережі 19.09.2026 16:27
UBTECH запустила фабрику гуманоїдних роботів із проєктною потужністю понад 10 000 машин на рік Технології 19.09.2026 16:20
Apple, Samsung і Google можуть зіткнутися з обмеженням імпорту пристроїв у США через патентну суперечку IT-бізнесГаджети 19.09.2026 16:11
CONTROL Resonant вийде 24 вересня — Remedy розкрила деталі глобального запуску Ігри 19.09.2026 15:52
Науковці виростили людську кіркову тканину в мозку мишей — вона зайняла близько 92% об’єму їхньої кори Наука 19.09.2026 15:36

Alibaba представила Qwen3.8-LiveTranslate — ШІ перекладає мовлення в реальному часі та розрізняє співрозмовників

Max Ivanov · 19.09.2026 23:18 · 3 хвилини читання

Команда Qwen з Alibaba представила Qwen3.8-LiveTranslate — нову модель для синхронного перекладу аудіо та відео в реальному часі. Система підтримує 60 мов, уміє розрізняти учасників розмови, враховувати попередній контекст і озвучувати переклад голосом, близьким за тембром до оригінального спікера.

За даними Qwen, середня затримка перекладу за метрикою LAAL знизилася з 2,8 до 2,3 секунди порівняно з попереднім поколінням. Це не означає гарантованої затримки рівно 2,3 секунди для будь-якого користувача: підсумковий час також залежить від з’єднання, буферизації та способу відтворення.

В основі моделі лежить нова архітектура Interleave. Замість класичної послідовності «розпізнавання мовлення → переклад → синтез голосу» система працює з аудіо та текстовою інформацією як з єдиною часовою послідовністю. Уже оброблений звук і створений переклад можуть повторно використовуватися з контексту, що, за твердженням розробників, водночас підвищує зв’язність перекладу та зменшує затримку.

ШІ розрізняє кількох мовців і зберігає їхні голоси

Одне з головних нововведень — розділення спікерів у реальному часі. Під час розмови кількох людей Qwen визначає, кому належить кожна репліка, і зберігає цю прив’язку в перекладі.

Під час голосового виведення модель також намагається відтворювати індивідуальний тембр кожного учасника. Така функція розрахована насамперед на наради, інтерв’ю, конференції та інші ситуації, де важливо розуміти не лише зміст розмови, а й те, хто саме говорить.

Qwen3.8-LiveTranslate може одночасно показувати оригінальну розшифровку та переклад, а довгий контекст допомагає системі точніше обробляти імена, спеціальні терміни та неоднозначні вирази, сенс яких стає зрозумілим лише з попередніх реплік.

Модель також приймає зображення разом з аудіо. У документації QwenCloud зазначено, що візуальна інформація — наприклад, текст на екрані, жести чи інші деталі відеопотоку — може використовуватися для уточнення перекладу.

Голосовий переклад доступний не для всіх 60 мов

Заявлені 60 мов стосуються розпізнавання мовлення та текстового перекладу. Синтез перекладеного голосу поки що підтримується для 29 мов. Повний список компанія наводить у документації QwenCloud.

Спробувати технологію можна через вебдемонстрацію LiveTranslate. Розробникам доступна модель qwen3.8-livetranslate-flash-realtime через API. Її контекстне вікно становить близько 53 тисяч токенів, а міжнародний тариф починається з $7,50 за мільйон вхідних аудіотокенів; синтез мовлення коштує $30 за мільйон вихідних аудіотокенів.

У власних тестах Alibaba нова версія обійшла Qwen3.5-LiveTranslate та інші системи за якістю перекладу, розпізнаванням мовлення, затримкою та роботою з кількома спікерами. Поки що це результати самої Qwen, тож реальну різницю з конкурентами ще належить оцінити в незалежних порівняннях.

Подобається ВсеЗависло?

Додайте нас до улюблених джерел Google, щоб частіше бачити наші новини.

Додай нас у свій Google

Поділитися

Залишити коментар