Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей.
Z.ai выпустила модель в августе, веса выложила через две недели.
Двумя неделями ранее её проверял CAISI, центр стандартов и инноваций ИИ при американском институте NIST, и назвал сильной в киберзадачах среди открытых моделей на сегодня.
По словам Anthropic, в ExploitBench GLM-5.3 довела до рабочего эксплойта известные уязвимости движка V8 в 50 попытках из 410, это 12%.
У Claude Mythos Preview результат 14%, у GLM-5.2 и Claude Opus 4.6 близок к нулю.
В ручных сессиях с человеком модель находила ранее неизвестные уязвимости в браузере и драйверах, а встроенные ограничения, утверждает Anthropic, обходятся без особых усилий и в открытых весах их можно снять.
🟡CAISI более сдержан в описании результатов
На четырёх кибербенчмарках GLM-5.3 заметно слабее американских передовых моделей, в SEC-Bench Pro она решает 40,4% задач против 90,2%.
Совокупное отставание CAISI оценивает примерно в четыре месяца.
Вывод обеих организаций совпадает в главном - возможности, которые год назад были только у закрытых лабораторий, теперь доступны любому, кто скачает веса.
В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств.
Z.ai пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic.
@ai_machinelearning_big_data
#news #ai #ml
