На Hugging Face появилась uncensored-версия GLM-5.3, квантованная в формат EXL3 под ExLlamaV3. Средняя разрядность 3.04 bpw, веса весят 273 GiB.
В основе лежит полноценная GLM-5.3 от Z.ai. Это MoE на 753B параметров: 256 роутируемых экспертов, из которых 8 активны на каждом токене, плюс один общий эксперт. Отказы сняли правкой весов без файнтюна, изменения описаны в файле
CRACK_SURGERY.json. Сам EXL3-квант сделан поверх этой правки.Качество сжатия измерили. KL-дивергенция против FP8 составляет 0.089, перплексия выросла с 3.302 до 3.440. На tau2-bench агентные метрики почти не просели.
Модель запускали на 8× A100 40GB через TabbyAPI с разбиением слоёв по картам, контекст ограничили 65K токенов.
Есть важная ловушка с tool calling. GLM пишет аргументы инструментов как сырой текст, а парсер glm4_5 в TabbyAPI пытается разобрать каждое значение как JSON. Из-за этого около 70% вызовов в retail-задачах падают, пока парсер не поправишь.
Модель подойдёт тем, кто гоняет большие MoE локально и хочет модель без отказов. Защитных ограничений у неё нет, так что за то, что она выдаёт, отвечает тот, кто её развернул.
https://huggingface.co/Infatoshi/GLM-5.3-UNCENSORED-EXL3-3.0bpw
