PrismML випустила Bonsai 2 27B — 27-мільярдна ШІ-модель займає лише 5,9 ГБ

Американська PrismML представила Ternary Bonsai 2 27B — мультимодальну ШІ-модель на базі Qwen3.8 27B, оптимізовану для локального запуску. Попри 27,8 млрд параметрів, її ваги займають лише 5,9 ГБ — це більш ніж у дев’ять разів менше за повноточну версію вихідної моделі.
Такого результату розробники досягли завдяки тернарному представленню ваг. Замість звичайних 16-бітних значень більшість параметрів набуває лише трьох станів: −1, 0 або +1. Разом із груповим масштабуванням FP16 це дає ефективну щільність близько 1,76 біта на параметр.
Для порівняння: повноточна версія Qwen3.8 27B займає близько 53,8 ГБ. Тобто головна перевага Bonsai 2 полягає не в зменшенні кількості параметрів, а в радикальному скороченні пам’яті, потрібної для зберігання та запуску моделі.
Стиснення майже не змінило результати в тестах PrismML
За даними PrismML, Bonsai 2 27B набрала 83,9 бала в наборі з 20 тестів із математики, програмування, міркувань, виконання інструкцій, комп’ютерного зору та роботи з інструментами. Повноточна Qwen3.8 27B отримала 85,4 бала.
Отже, стиснена модель зберегла близько 98,2% сукупного результату оригіналу. Втім, різниця залежить від конкретної задачі. Наприклад, у групі тестів із комп’ютерного зору Bonsai 2 отримала 78,59 бала проти 81,64 у повноточної Qwen3.8.
Поки що це результати самої PrismML, тож реальну якість моделі ще належить перевірити в незалежних тестах і практичних сценаріях.
Bonsai 2 підтримує контекст до 262 тисяч токенів, приймає текст і зображення, уміє писати код, міркувати, викликати інструменти та працювати в агентних системах. Компанія демонструвала модель у зв’язці з Cline для програмування та в сценаріях керування комп’ютером.

До 143 токенів за секунду на RTX 5090
Продуктивність залежить від апаратної платформи. PrismML заявляє швидкість до 143 токенів за секунду на GeForce RTX 5090 і до 46,8 токена за секунду на Apple M5 Max.
На RTX 4090 компанія виміряла енергоспоживання близько 0,714 мВт·год на токен. Усі ці показники отримано в тестах самого розробника, і вони можуть відрізнятися залежно від конфігурації, довжини контексту та програмного стеку.
Модель працює на відеокартах NVIDIA через CUDA, а на пристроях Apple — через MLX і власні low-bit ядра PrismML. На Hugging Face вже доступні GGUF-збірка та MLX-версія.
Ваги поширюються безкоштовно за ліцензією Apache 2.0, яка дозволяє використовувати модель зокрема в комерційних проєктах за дотримання умов ліцензії.
Головний інтерес Bonsai 2 — у можливості запускати модель класу 27B на значно доступнішому залізі. Якщо заявлене збереження якості підтвердиться поза внутрішніми тестами PrismML, тернарні моделі можуть стати одним зі способів перенести більші ШІ-системи із серверів безпосередньо на персональні пристрої.