MiniMax выложила в открытый доступ веса нейросети Music 3 для генерации музыки

Китайская компания MiniMax опубликовала веса и программный код нейросети для создания музыки MiniMax Music 3. Модель умеет генерировать полноценные треки с вокалом и инструменталом длительностью до 5 минут, а её файлы и демонстрационная веб-версия доступны на платформе Hugging Face.
Модель синтезирует стереодорожки в формате WAV (32 кГц, 16 бит), сохраняя классическую структуру песни с куплетами, припевами, бриджами и соло. Для управления генерацией используются два поля ввода: текст песни (lyrics) и музыкальное описание (music description). Разработчики рекомендуют разделять описание на три блока: метаданные стиля (жанр, темп в BPM, тональность), параметры вокала и детали аранжировки инструментов.
Архитектура и системные требования
В основе Music 3 используется двухуровневая архитектура:
- Global LLM (8 млрд параметров): создана на базе Qwen3-8B и отвечает за общую композицию и развитие трека во времени;
- Local LLM (0,6 млрд параметров): генерирует акустические детали и вокальные переходы;
- Flow Matching и Flow-VAE: отвечают за финальный синтез звуковой волны.
Размер полного репозитория составляет 57,4 ГБ. Для работы в стандартном режиме производитель рекомендует видеокарту с 24 ГБ видеопамяти, однако поддержка выгрузки слоёв на процессор (CPU-offloading) позволяет запускать генерацию на потребительских GPU с 8 ГБ VRAM. Модель поддерживает интеграцию с фреймворками Diffusers, SGLang и нодовой средой ComfyUI.
Условия лицензии
Модель распространяется по свободной лицензии MiniMax-Music3 Community License. Её разрешено бесплатно использовать для локальных тестов и коммерческих сервисов, если годовой доход компании не превышает $20 млн.
Файлы и веса выложены в официальном репозитории MiniMax на Hugging Face, а технические инструкции по развёртыванию описаны в документации платформы.


