Помните пост про abliterated-модели, у которых можно ослабить привычку отвечать «извините, я не могу вам с этим помочь»?
Anthropic проделали это с GLM-5.3. В среднем по трём тестам доля отказов упала примерно с 95% до 6%. На остальных бенчмарках способности модели при этом практически не изменились.
На ExploitBench модель получила 12% успешных попыток разработки полноценного эксплойта против 14% у Mythos Preview.
При этом веса GLM доступны всем, а Mythos Preview дают попробовать только избранным компаниям из США.
В общем, неплохой отзыв от конкурента для лаборатории из Китая)
@ai_for_devs

