Tencent випустила нейромережу AuK: заміна слів в аудіозаписі, відокремлення вокалу та клонування голосу

Команда Tencent Hunyuan представила AuK — універсальну модель із відкритим вихідним кодом для генерації, редагування та реставрації мовлення за допомогою текстових інструкцій. Розробка вирішує завдання, для яких раніше доводилося використовувати кілька окремих розширень: вона вміє клонувати голос за коротким семплом, точково виправляти обмовки у вже зведеній доріжці, змінювати емоції спікера та вирізати вокал із музичного треку. Ваги та код опубліковано під вільною ліцензією MIT.
Текстовий монтаж звуку та паралінгвістика
Головна відмінність AuK від класичних генераторів мовлення (TTS) — глибокі можливості редагування вже наявного звуку. Як зазначено на сторінці моделі на Hugging Face, керування будується через природні текстові команди:
- Точковий інпейнтинг: користувач може виділити фрагмент запису та замінити слово чи вставити фразу — модель синтезує недостатній відрізок із тим самим тембром і диханням спікера;
- Паралінгвістичні правки: за текстовим запитом можна змінити емоційне забарвлення, прибрати місцевий акцент, перевести голос у шепіт або додати природний сміх і покашлювання;
- Акустичне очищення: система пригнічує реверберацію приміщень, зрізає фоновий шум і розділяє співрозмовників, які перебивають один одного, на ізольовані доріжки.
Масштаб навчальної вибірки вражає: згідно з технічним звітом на arXiv, інженери навчили алгоритм на 3,03 мільярда пар «інструкція — аудіо», що еквівалентно майже двом мільйонам годин живого мовлення.
🚀 AuK is officially here. Nano banana🍌 for audio
— Tencent Hy (@TencentHunyuan) September 10, 2026
An open-source foundation model for unified speech generation and editing.
Natural-language instructions + reference audio. One interface.
Zero-shot TTS. Instruction-controlled generation. Content editing. Whisper-conversion.… pic.twitter.com/AIOOzPYFNL
Апаратні вимоги та швидка версія AuK-Flash
У дописах у соцмережах архітектуру часто спрощують, називаючи легкою моделлю на 1,5 млрд параметрів. Насправді робочий пайплайн потребує потужного відеоприскорювача: сам генеративний модуль займає 6,12 ГБ, однак разом із ним у пам’ять завантажуються енкодер Qwen2.5-Omni-3B та модуль VAE-стиснення.
Для ПК зі скромним обсягом відеопам’яті розробники випустили дистильовану версію AuK-Flash: вона витрачає лише чотири кроки на генерацію аудіо та працює в 4,5 раза швидше за базовий алгоритм, практично не поступаючись оригіналу в розбірливості.
Код проєкту викладено в офіційному репозиторії Tencent на GitHub. Розробники від початку передбачили консольний клієнт, вебдемо на базі Gradio та готові модулі для популярного інтерфейсу ComfyUI, перетворивши реліз на доступний безкоштовний інструмент для локального озвучення відео та подкастів.