GLM настолько классная
Что ее надо запретить
Пять месяцев назад Anthropic решила, что Claude Mythos Preview слишком хорошо пишет эксплойты для публичного релиза, и выдала ее только проверенным защитникам через Project Glasswing. Теперь компания бьет тревогу: похожие способности появились у модели, которую может скачать любой. Речь о GLM-5.3 от китайской Zhipu (за пределами Китая Z.ai). По версии Anthropic, это первая открытая модель, которая сама, от начала до конца, собирает рабочие эксплойты.
Сравнивает Anthropic ее как раз с Mythos Preview. На ExploitBench модели дают известную уязвимость в V8, движке JavaScript из Chrome, и просят превратить ее в работающую атаку. Mythos Preview справляется в 14% попыток, открытая Kimi K3 почти никогда, GLM-5.3 в 12%. Актуальной Mythos 5.1 в сравнении нет.
Государственный CAISI при NIST сравнивал GLM-5.3 с лучшими американскими моделями и увидел другую картину. По его оценке, это самая сильная открытая модель в кибере, но она заметно слабее фронтира США и отстает от него примерно на четыре месяца. В версии ExploitBench от CAISI у GLM-5.3 61,1%, у лучшей американской модели 100%. Считают там, правда, иначе.
Вернемся к исследованию Anthropic, на прямую просьбу атаковать критическую систему GLM-5.3 отказывает. Но если сказать ей, что она участвует в учениях red-team, соглашается в 64% случаев. Если заранее вписать в ее рассуждения решение продолжать (такой прием называют prefill), в 92%. А после abliteration, когда гардрейлы вырезают прямо из весов, в 100%. Опытной команде, по оценке Anthropic, на это хватит компьюта примерно на $1200.
Claude, разумеется, безопасен.. Вот только вписать что-то в рассуждения Claude через API Anthropic нельзя, а вырезать гардрейлы без доступа к весам невозможно. Этот ноль говорит не о стойкости Claude, а о том, что его веса закрыты. Kimi K3 и DeepSeek, чьи веса тоже открыты, в эту часть сравнения не попали.
Самая жуткая цитата отчета, где модель рассуждает о задаче тихо убивать людей, принадлежит копии GLM-5.3, из которой отказы гардрейлы вырезала Anthropic. И получена она в симуляции.
При этом сами способности не выдуманы. За день работы с исследователем GLM-5.3 нашла несколько неизвестных уязвимостей в JS-движке популярного браузера и собрала из них страницу, которая крадет файлы с компьютера посетителя. Облегченная GLM-5.3-Flash за 8 часов собственной работы и 20 минут внимания человека сделала из двух опубликованных CVE цепочку атак на Chrome под ARM64 с обходом аппаратной защиты указателей. По тарифам Zhipu это стоило бы $20,40. Версии без гардрейлов, по словам Anthropic, появились в сети через несколько дней после открытия весов.
Рецепт Anthropic: государствам тестировать такие модели, авторам открытых весов ставить защиты, а защитникам дать больше доступа к фронтирным моделям, включая Claude Mythos 5.1.
Лучшую рекламу GLM-5.3 сделал ее конкурент. Себя, правда, тоже не забыл.
@anti_agi
Post #2148
2.17K