Tencent открыла нейросеть AuK: замена слов в аудиозаписи, отделение вокала и клонирование голоса

Команда Tencent Hunyuan представила AuK — универсальную модель с открытым исходным кодом для генерации, редактирования и реставрации речи с помощью текстовых инструкций. Разработка решает задачи, под которые раньше требовалось держать несколько отдельных плагинов: она умеет клонировать голос по короткому сэмплу, точечно исправлять оговорки в уже сведенной дорожке, менять эмоции спикера и вырезать вокал из музыкального трека. Веса и код опубликованы под свободной лицензией MIT.
Текстовый монтаж звука и паралингвистика
Главное отличие AuK от классических генераторов речи (TTS) — глубокие возможности редактирования уже существующего звука. Как указано на странице модели на Hugging Face, управление строится через естественные текстовые команды:
- Точечный инпейнтинг: пользователь может выделить фрагмент записи и заменить слово или вставить фразу — модель синтезирует недостающий отрезок с тем же тембром и дыханием спикера;
- Паралингвистические правки: по текстовому запросу можно изменить эмоциональную окраску, убрать местный акцент, перевести голос в шепот или добавить естественный смех и покашливание;
- Акустическая очистка: система подавляет реверберацию помещений, срезает фоновый шум и разделяет перебивающих друг друга собеседников на изолированные дорожки.
Масштаб обучающей выборки впечатляет: согласно техническому отчету на arXiv, инженеры обучили алгоритм на 3,03 миллиарда пар «инструкция — аудио», что эквивалентно почти двум миллионам часов живой речи.
🚀 AuK is officially here. Nano banana🍌 for audio
— Tencent Hy (@TencentHunyuan) September 10, 2026
An open-source foundation model for unified speech generation and editing.
Natural-language instructions + reference audio. One interface.
Zero-shot TTS. Instruction-controlled generation. Content editing. Whisper-conversion.… pic.twitter.com/AIOOzPYFNL
Аппаратные требования и быстрая версия AuK-Flash
В сообщениях социальных сетей архитектуру часто упрощают, называя легкой моделью на 1,5 млрд параметров. В действительности рабочий пайплайн требует мощного видеоускорителя: сам генеративный модуль занимает 6,12 ГБ, однако вместе с ним в память подгружаются энкодер Qwen2.5-Omni-3B и модуль VAE-сжатия.
Для ПК со скромным объемом видеопамяти разработчики выпустили дистиллированную версию AuK-Flash: она тратит всего четыре шага на генерацию аудио и работает в 4,5 раза быстрее базового алгоритма, практически не уступая оригиналу в разборчивости.
Код проекта выложен в официальном репозитории Tencent на GitHub. Разработчики изначально предусмотрели консольный клиент, веб-демо на базе Gradio и готовые модули для популярного интерфейса ComfyUI, превратив релиз в доступный бесплатный инструмент для локальной озвучки видео и подкастов.