На Hugging Face выложили «нецензурированную» GLM-5.3 на 753 млрд параметров – даже квантовку тестировали на восьми A100

На Hugging Face появилась неофициальная «нецензурированная» версия GLM-5.3 от Z.ai, в которой авторы попытались существенно снизить количество отказов на чувствительные запросы. Модель содержит 753 млрд параметров, а даже её сильно сжатая версия занимает около 273 ГиБ, поэтому обычному домашнему компьютеру она практически недоступна.
Речь идёт о GLM-5.3-UNCENSORED-EXL3-3.0bpw, созданной пользователем Infatoshi. Это сторонний проект, не связанный с Z.ai.
Основой послужила официальная GLM-5.3 – Mixture-of-Experts-модель с 753 млрд параметров, 256 маршрутизируемыми экспертами и восемью активными экспертами на токен. Z.ai ориентирует её прежде всего на программирование, длительные агентные задачи и кибербезопасность.
Ограничения меняли прямо в весах модели
«Uncensored»-версия появилась без традиционного дополнительного обучения.
Сначала автор другого проекта, dealignai, отредактировал FP8-веса GLM-5.3, чтобы изменить поведение модели и уменьшить вероятность отказов. Затем Infatoshi дополнительно квантовал эту версию в формат EXL3 примерно до 3,04 бита на вес.
Поэтому слово «uncensored» здесь стоит воспринимать как название и заявленную цель модификации, а не гарантию полного отсутствия ограничений. Поведение модели после редактирования весов и агрессивной квантовки может отличаться от исходной GLM-5.3.
Сам автор провёл небольшое сравнение с оригинальной FP8-версией. На двух агентных тестах квантованная модель показала несколько более низкие результаты, однако при использованном размере выборки разница не достигла статистической значимости.

273 ГиБ – и это уже сильно сжатая версия
Главная проблема для локального запуска – размеры.
EXL3-квантовка занимает около 273 ГиБ. Автор тестировал её через TabbyAPI на системе с восемью NVIDIA A100 по 40 ГБ, то есть с суммарными 320 ГБ видеопамяти.
Это хорошо показывает масштаб модели: даже после уменьшения точности примерно до трёх бит она остаётся далеко за пределами возможностей обычной игровой видеокарты и большинства рабочих станций.
Полноценная FP8-версия требует ещё значительно больше памяти. Теоретически часть модели можно выгружать в оперативную память или использовать другие схемы распределённого запуска, но это серьёзно усложняет конфигурацию и обычно снижает скорость генерации.
FOUND A MASSIVE UNCENSORED GLM-5.3 MODEL 👀
— Forha (@Forhanvv) October 2, 2026
GLM-5.3 UNCENSORED is available in EXL3 3.0bpw for local inference.
• based on GLM-5.3
• uncensored / refusal-reduced
• EXL3 3.0bpw quantization
• 146B parameters listed on Hugging Face
• built for local inference
• compatible… https://t.co/8d3Q2LpvQo pic.twitter.com/4VfmzBdL8A
При этом скачать веса можно бесплатно. Репозиторий конкретной EXL3-модификации помечен лицензией MIT, однако бесплатные веса не означают бесплатную эксплуатацию – для комфортного запуска потребуется дорогое серверное оборудование или аренда нескольких GPU.
На момент публикации эта версия также не подключена ни к одному встроенному inference-провайдеру Hugging Face, поэтому запустить её непосредственно со страницы модели одной кнопкой нельзя.
Получилась довольно показательная иллюстрация современного open-weight ИИ: модель действительно можно скачать и развернуть самостоятельно, но её 753 млрд параметров превращают «локальный запуск» скорее в задачу для GPU-сервера, чем для домашнего ПК.