Anthropic опубликовала разгромный отчёт о китайской GLM-5.3 — и случайно сделала ей рекламу
Продолжение поста
Исследователи Anthropic сами взяли GLM-5.3, нашли с её помощью ранее неизвестную уязвимость в браузере и в изолированной среде собрали цепочку атаки, позволяющую читать файлы с тестового компьютера.
Отдельно исследователи проверили младшую версию — GLM-5.3-Flash. Взяв свежую уязвимость Chrome (CVE-2026-11645) и данные об уже известном баге, они за ~20 минут ручной работы и ~8 часов работы модели собрали стабильную цепочку атаки на платформе ARM64, обойдя защиту указателей (PAC). Стоимость вызовов API составила $20,40.
Второй блок отчёта посвящён «снятию ограничений» — технике abliteration, при которой веса открытой модели модифицируются так, чтобы она перестала отказывать на вредоносные запросы. Anthropic провела эту процедуру сама: ~2200 GPU-часов и ~$4400 вычислительных затрат.
После этого доля отказов GLM-5.3 на бенчмарках JailbreakBench и HarmBench упала с 90%+ до ~3% и ~2% соответственно, на StrongREJECT — до 12%. Способности модели при этом почти не пострадали.
Anthropic оговаривается, что те же приёмы против Claude не сработали — потому что веса Claude закрыты и API не позволяет предзаполнять «мысли» модели.
Но это разница в продуктовой модели, а не в качестве защиты: у GLM-5.3 при выпуске в августе Zhipu задержала открытие весов на две недели для аудита безопасности и открыла самые чувствительные функции только через верифицированную программу доступа — что в целом похоже на подход Anthropic к собственному Claude Mythos 5.1.
По итогам отчёта Anthropic призвала расширить доступ проверенных специалистов по защите к сильным моделям и провести независимый аудит безопасности GLM-5.3 и её будущих версий. Стоимость этого аудита для Zhipu — судя по реакции сети — равна нулю: отчёт конкурента уже разошёлся по всем профильным каналам.
Источник: QbitAI (🇨🇳)
#Anthropic #Zhipu #GLM #ИИ #безопасность
Post #3066
5