Таємнича нейромережа Ox Alpha виявилася GLM-5.3-Flash: відкрита модель на 320 млрд параметрів кидає виклик Claude

Компанія Z.ai офіційно представила відкриту мультимодальну модель GLM-5.3-Flash, розкривши таємницю анонімної нейромережі Ox Alpha, яка проходила сліпе тестування на платформі OpenRouter. Модель на 320 млрд параметрів з архітектурою Mixture-of-Experts наблизилася за можливостями кодування до закритих флагманів рівня Claude Opus 4.8, витрачаючи вдесятеро менше обчислювальних ресурсів.
З безкоштовним розкриттям ваг анонімний тестовий період Ox Alpha офіційно завершено.
Архітектура MoE та гібридна увага на 30 трлн токенів
Модель навчалася на мультимодальному масиві з 30 трлн токенів, отримавши нативну підтримку розпізнавання тексту та візуальних зображень.
Завдяки архітектурі Mixture-of-Experts (MoE) із загального масиву в 320 млрд параметрів для обробки кожного конкретного токена активується лише 18 млрд, що дає змогу запускати модель із відносно невисокими вимогами до апаратного інференсу.
Щоб здешевити обробку довгого контексту розміром до 1 млн токенів, розробники вперше поєднали розріджену (sparse) та лінійну (linear) увагу. Початковий код і ваги викладено в репозиторії Hugging Face під вільною ліцензією MIT, яка дозволяє комерційне використання.
Результати в бенчмарках із програмування
У тестах на виконання консольних команд Terminal-Bench 2.1 модель набрала 84,3 бала, а в комплексному агентському бенчмарку розробки ПЗ DeepSWE показала 63,4% успішних рішень.
За даними Z.ai, у прикладних завданнях із написання коду модель конкурує з топовими комерційними нейромережами, при цьому вартість генерації токенів виявилася в 10 разів нижчою порівняно з GLM-5.2.

Доступність через API та локальне розгортання
Після презентації модель доступна під офіційною назвою в каталозі сервісу OpenRouter та через власну платформу Z.ai.
Для локального запуску та інтеграції в корпоративні контури забезпечено підтримку бібліотек vLLM, SGLang, KTransformers та TokenSpeed.