Вс, 20 Сен
Совпадение музыкальных вкусов у романтических пар оказалось сильнее сходства характеров Наука 19.09.2026 23:27
Alibaba представила Qwen3.8-LiveTranslate — ИИ переводит речь в реальном времени и различает собеседников Нейросети 19.09.2026 23:18
Онлайн ARC Raiders продолжает снижаться — крупное обновление Frozen Trail выйдет 8 октября Игры 19.09.2026 22:48
Tesla планирует начать продажи роботов Optimus во второй половине 2027 года Технологии 19.09.2026 16:58
Алан Ритчсон может сыграть главную роль в экранизации Helldivers ИгрыКино/Сериалы 19.09.2026 16:55
Ferrari представила 296 GT Modificata — 730-сильный трековый суперкар без ограничений гоночного регламента Автомобили 19.09.2026 16:50
CNN: ошибочный ИИ-анализ едва не привёл к военной операции США против китайского судна Нейросети 19.09.2026 16:27
UBTECH запустила фабрику гуманоидных роботов с проектной мощностью более 10 000 машин в год Технологии 19.09.2026 16:20
Apple, Samsung и Google могут столкнуться с ограничением импорта устройств в США из-за патентного спора IT-бизнесГаджеты 19.09.2026 16:11
CONTROL Resonant выйдет 24 сентября — Remedy раскрыла детали глобального запуска Игры 19.09.2026 15:52
Учёные вырастили человеческую корковую ткань в мозге мышей — она заняла около 92% объёма их коры Наука 19.09.2026 15:36

Alibaba представила Qwen3.8-LiveTranslate — ИИ переводит речь в реальном времени и различает собеседников

Max Ivanov · 19.09.2026 23:18 · 3 минуты чтения

Команда Qwen из Alibaba представила Qwen3.8-LiveTranslate — новую модель для синхронного перевода аудио и видео в реальном времени. Система поддерживает 60 языков, умеет различать участников разговора, учитывать предыдущий контекст и озвучивать перевод голосом, близким по тембру к оригинальному спикеру.

По данным Qwen, средняя задержка перевода по метрике LAAL снизилась с 2,8 до 2,3 секунды по сравнению с предыдущим поколением. Это не означает гарантированную задержку ровно 2,3 секунды для любого пользователя: итоговое время также зависит от соединения, буферизации и способа воспроизведения.

В основе модели лежит новая архитектура Interleave. Вместо классической последовательности «распознавание речи → перевод → синтез голоса» система работает с аудио и текстовой информацией как с единой временной последовательностью. Уже обработанный звук и созданный перевод могут повторно использоваться из контекста, что, по утверждению разработчиков, одновременно повышает связность перевода и уменьшает задержку.

ИИ различает нескольких говорящих и сохраняет их голоса

Одно из главных нововведений — разделение спикеров в реальном времени. Во время разговора нескольких людей Qwen определяет, кому принадлежит каждая реплика, и сохраняет эту привязку в переводе.

При голосовом выводе модель также старается воспроизводить индивидуальный тембр каждого участника. Такая функция рассчитана прежде всего на совещания, интервью, конференции и другие ситуации, где важно понимать не только содержание разговора, но и кто именно говорит.

Qwen3.8-LiveTranslate может одновременно показывать оригинальную расшифровку и перевод, а длинный контекст помогает системе точнее обрабатывать имена, специальные термины и неоднозначные выражения, смысл которых становится понятен только из предыдущих реплик.

Модель также принимает изображения вместе с аудио. В документации QwenCloud говорится, что визуальная информация — например, текст на экране, жесты или другие детали видеопотока — может использоваться для уточнения перевода.

Голосовой перевод доступен не для всех 60 языков

Заявленные 60 языков относятся к распознаванию речи и текстовому переводу. Синтез переведённого голоса пока поддерживается для 29 языков. Полный список компания приводит в документации QwenCloud.

Попробовать технологию можно через веб-демонстрацию LiveTranslate. Для разработчиков доступна модель qwen3.8-livetranslate-flash-realtime через API. Её контекстное окно составляет около 53 тысяч токенов, а международный тариф начинается с $7,50 за миллион входных аудиотокенов; синтез речи стоит $30 за миллион выходных аудиотокенов.

В собственных тестах Alibaba новая версия обошла Qwen3.5-LiveTranslate и другие системы по качеству перевода, распознаванию речи, задержке и работе с несколькими спикерами. Пока это результаты самой Qwen, поэтому реальную разницу с конкурентами ещё предстоит оценить в независимых сравнениях.

Нравится ВсёЗависло?

Добавьте нас в предпочитаемые источники Google, чтобы чаще видеть наши новости.

Добавь нас в свой Google

Поделиться

Оставить комментарий