Таинственная нейросеть Ox Alpha оказалась GLM-5.3-Flash: открытая модель на 320 млрд параметров бросает вызов Claude

Компания Z.ai официально представила открытую мультимодальную модель GLM-5.3-Flash, раскрыв тайну анонимной нейросети Ox Alpha, которая проходила слепое тестирование на платформе OpenRouter. Модель на 320 млрд параметров с архитектурой Mixture-of-Experts приблизилась по возможностям кодинга к закрытым флагманам уровня Claude Opus 4.8, расходуя в десять раз меньше вычислительных ресурсов.
С бесплатным раскрытием весов анонимный тестовый период Ox Alpha официально завершён.
Архитектура MoE и гибридное внимание на 30 трлн токенов
Модель обучалась на мультимодальном массиве из 30 трлн токенов, получив нативную поддержку распознавания текста и визуальных изображений.
Благодаря архитектуре Mixture-of-Experts (MoE) из общего массива в 320 млрд параметров для обработки каждого конкретного токена активируется только 18 млрд, что позволяет запускать модель с относительно невысокими требованиями к аппаратному инференсу.
Для удешевления обработки длинного контекста размером до 1 млн токенов разработчики впервые объединили разреженное (sparse) и линейное (linear) внимание. Исходный код и веса выложены в репозитории Hugging Face под свободной лицензией MIT, разрешающей коммерческое использование.
Результаты в бенчмарках на программирование
В тестах на выполнение консольных команд Terminal-Bench 2.1 модель набрала 84,3 балла, а в комплексном агентском бенчмарке разработки ПО DeepSWE показала 63,4% успешных решений.
По данным Z.ai, в прикладных задачах написания кода модель конкурирует с топовыми коммерческими нейросетями, при этом стоимость генерации токенов оказалась в 10 раз ниже по сравнению с GLM-5.2.

Доступность через API и локальное развёртывание
После презентации модель доступна под официальным наименованием в каталоге сервиса OpenRouter и через собственную платформу Z.ai.
Для локального запуска и интеграции в корпоративные контуры обеспечена поддержка библиотек vLLM, SGLang, KTransformers и TokenSpeed.