Вс, 20 Сен
Binance запускает круглосуточные валютные фьючерсы с плечом до 100x Крипто 20.09.2026 19:29
ИИ ошибается в 57% финансовых ответов — на сложных вопросах доля ошибок достигает 88% Нейросети 20.09.2026 19:26
BYD обновила Yuan UP: до 501 км запаса хода и цена от $10,4 тысячи с учётом trade-in Автомобили 20.09.2026 19:00
«Цугай загробного мира» получит второй сезон — продолжение уже запущено в производство Кино/Сериалы 20.09.2026 18:27
GPT-6 Astra помогла расшифровать немецкую военную радиограмму 1918 года спустя 108 лет Нейросети 20.09.2026 18:26
Bloodborne получила локальный кооператив на одном ПК — фанаты запустили split-screen через shadPS4 Игры 20.09.2026 18:09
Владельцы гибридов оказались довольнее всех, электромобилей — меньше всего: исследование ACSI 2026 Автомобили 20.09.2026 18:05
Хавьер Бардем сыграет миллиардера в новом сериале HBO The Spread от соавтора «Озарка» Кино/Сериалы 20.09.2026 17:35
Для Mewgenics вышел фанатский кооперативный мод — Adventure теперь можно проходить вдвоём Игры 20.09.2026 17:31
Сон короче шести и дольше восьми часов связали с ускоренным биологическим старением Наука 20.09.2026 17:27
Почему Молния Маккуин ездит под номером 95 — Pixar спрятала в нём отсылку к «Истории игрушек» Кино/Сериалы 20.09.2026 17:21

PrismML выпустила Bonsai 2 27B — 27-миллиардная ИИ-модель занимает всего 5,9 ГБ

Max Ivanov · 20.09.2026 16:52 · 3 минуты чтения

Американская PrismML представила Ternary Bonsai 2 27B — мультимодальную ИИ-модель на базе Qwen3.8 27B, оптимизированную для локального запуска. Несмотря на 27,8 млрд параметров, её веса занимают всего 5,9 ГБ, что более чем в девять раз меньше полноточной версии исходной модели.

Такого результата разработчики добились за счёт тернарного представления весов. Вместо обычных 16-битных значений большая часть параметров принимает только три состояния: −1, 0 или +1. Вместе с групповым масштабированием FP16 это даёт эффективную плотность около 1,76 бита на параметр.

Для сравнения, полноточная версия Qwen3.8 27B занимает около 53,8 ГБ. То есть главное преимущество Bonsai 2 заключается не в уменьшении числа параметров, а в радикальном сокращении памяти, необходимой для хранения и запуска модели.

Сжатие почти не изменило результаты в тестах PrismML

По данным PrismML, Bonsai 2 27B набрала 83,9 балла в наборе из 20 тестов по математике, программированию, рассуждениям, выполнению инструкций, компьютерному зрению и работе с инструментами. Полноточная Qwen3.8 27B получила 85,4 балла.

Таким образом, сжатая модель сохранила около 98,2% совокупного результата оригинала. Однако разница зависит от конкретной задачи. Например, в группе тестов компьютерного зрения Bonsai 2 получила 78,59 балла против 81,64 у полноточной Qwen3.8.

Пока это результаты самой PrismML, поэтому реальное качество модели ещё предстоит проверить в независимых тестах и практических сценариях.

Bonsai 2 поддерживает контекст до 262 тысяч токенов, принимает текст и изображения, умеет писать код, рассуждать, вызывать инструменты и работать внутри агентных систем. Компания демонстрировала модель в связке с Cline для программирования и в сценариях управления компьютером.

До 143 токенов в секунду на RTX 5090

Производительность зависит от аппаратной платформы. PrismML заявляет скорость до 143 токенов в секунду на GeForce RTX 5090 и до 46,8 токена в секунду на Apple M5 Max.

На RTX 4090 компания измерила энергопотребление около 0,714 мВт·ч на токен. Все эти показатели получены в тестах самого разработчика и могут отличаться в зависимости от конфигурации, длины контекста и используемого программного стека.

Модель работает на видеокартах NVIDIA через CUDA, а на устройствах Apple — через MLX и собственные low-bit ядра PrismML. На Hugging Face уже доступны GGUF-сборка и MLX-версия.

Весы распространяются бесплатно по лицензии Apache 2.0, позволяющей использовать модель в том числе в коммерческих проектах при соблюдении условий лицензии.

Главный интерес Bonsai 2 — в возможности запускать модель класса 27B на значительно более доступном железе. Если заявленное сохранение качества подтвердится вне внутренних тестов PrismML, тернарные модели могут стать одним из способов перенести более крупные ИИ-системы с серверов непосредственно на персональные устройства.

Нравится ВсёЗависло?

Добавьте нас в предпочитаемые источники Google, чтобы чаще видеть наши новости.

Добавь нас в свой Google

Поделиться

Оставить комментарий