PrismML выпустила Bonsai 2 27B — 27-миллиардная ИИ-модель занимает всего 5,9 ГБ

Американская PrismML представила Ternary Bonsai 2 27B — мультимодальную ИИ-модель на базе Qwen3.8 27B, оптимизированную для локального запуска. Несмотря на 27,8 млрд параметров, её веса занимают всего 5,9 ГБ, что более чем в девять раз меньше полноточной версии исходной модели.
Такого результата разработчики добились за счёт тернарного представления весов. Вместо обычных 16-битных значений большая часть параметров принимает только три состояния: −1, 0 или +1. Вместе с групповым масштабированием FP16 это даёт эффективную плотность около 1,76 бита на параметр.
Для сравнения, полноточная версия Qwen3.8 27B занимает около 53,8 ГБ. То есть главное преимущество Bonsai 2 заключается не в уменьшении числа параметров, а в радикальном сокращении памяти, необходимой для хранения и запуска модели.
Сжатие почти не изменило результаты в тестах PrismML
По данным PrismML, Bonsai 2 27B набрала 83,9 балла в наборе из 20 тестов по математике, программированию, рассуждениям, выполнению инструкций, компьютерному зрению и работе с инструментами. Полноточная Qwen3.8 27B получила 85,4 балла.
Таким образом, сжатая модель сохранила около 98,2% совокупного результата оригинала. Однако разница зависит от конкретной задачи. Например, в группе тестов компьютерного зрения Bonsai 2 получила 78,59 балла против 81,64 у полноточной Qwen3.8.
Пока это результаты самой PrismML, поэтому реальное качество модели ещё предстоит проверить в независимых тестах и практических сценариях.
Bonsai 2 поддерживает контекст до 262 тысяч токенов, принимает текст и изображения, умеет писать код, рассуждать, вызывать инструменты и работать внутри агентных систем. Компания демонстрировала модель в связке с Cline для программирования и в сценариях управления компьютером.

До 143 токенов в секунду на RTX 5090
Производительность зависит от аппаратной платформы. PrismML заявляет скорость до 143 токенов в секунду на GeForce RTX 5090 и до 46,8 токена в секунду на Apple M5 Max.
На RTX 4090 компания измерила энергопотребление около 0,714 мВт·ч на токен. Все эти показатели получены в тестах самого разработчика и могут отличаться в зависимости от конфигурации, длины контекста и используемого программного стека.
Модель работает на видеокартах NVIDIA через CUDA, а на устройствах Apple — через MLX и собственные low-bit ядра PrismML. На Hugging Face уже доступны GGUF-сборка и MLX-версия.
Весы распространяются бесплатно по лицензии Apache 2.0, позволяющей использовать модель в том числе в коммерческих проектах при соблюдении условий лицензии.
Главный интерес Bonsai 2 — в возможности запускать модель класса 27B на значительно более доступном железе. Если заявленное сохранение качества подтвердится вне внутренних тестов PrismML, тернарные модели могут стать одним из способов перенести более крупные ИИ-системы с серверов непосредственно на персональные устройства.