TGViewer
Неискусственный интеллект Неискусственный интеллект @anti_agi · 5.41K subscribers
Post #2148 2.17K
GLM настолько классная

Что ее надо запретить

Пять месяцев назад Anthropic решила, что Claude Mythos Preview слишком хорошо пишет эксплойты для публичного релиза, и выдала ее только проверенным защитникам через Project Glasswing. Теперь компания бьет тревогу: похожие способности появились у модели, которую может скачать любой. Речь о GLM-5.3 от китайской Zhipu (за пределами Китая Z.ai). По версии Anthropic, это первая открытая модель, которая сама, от начала до конца, собирает рабочие эксплойты.

Сравнивает Anthropic ее как раз с Mythos Preview. На ExploitBench модели дают известную уязвимость в V8, движке JavaScript из Chrome, и просят превратить ее в работающую атаку. Mythos Preview справляется в 14% попыток, открытая Kimi K3 почти никогда, GLM-5.3 в 12%. Актуальной Mythos 5.1 в сравнении нет.

Государственный CAISI при NIST сравнивал GLM-5.3 с лучшими американскими моделями и увидел другую картину. По его оценке, это самая сильная открытая модель в кибере, но она заметно слабее фронтира США и отстает от него примерно на четыре месяца. В версии ExploitBench от CAISI у GLM-5.3 61,1%, у лучшей американской модели 100%. Считают там, правда, иначе.

Вернемся к исследованию Anthropic, на прямую просьбу атаковать критическую систему GLM-5.3 отказывает. Но если сказать ей, что она участвует в учениях red-team, соглашается в 64% случаев. Если заранее вписать в ее рассуждения решение продолжать (такой прием называют prefill), в 92%. А после abliteration, когда гардрейлы вырезают прямо из весов, в 100%. Опытной команде, по оценке Anthropic, на это хватит компьюта примерно на $1200.

Claude, разумеется, безопасен.. Вот только вписать что-то в рассуждения Claude через API Anthropic нельзя, а вырезать гардрейлы без доступа к весам невозможно. Этот ноль говорит не о стойкости Claude, а о том, что его веса закрыты. Kimi K3 и DeepSeek, чьи веса тоже открыты, в эту часть сравнения не попали.

Самая жуткая цитата отчета, где модель рассуждает о задаче тихо убивать людей, принадлежит копии GLM-5.3, из которой отказы гардрейлы вырезала Anthropic. И получена она в симуляции.

При этом сами способности не выдуманы. За день работы с исследователем GLM-5.3 нашла несколько неизвестных уязвимостей в JS-движке популярного браузера и собрала из них страницу, которая крадет файлы с компьютера посетителя. Облегченная GLM-5.3-Flash за 8 часов собственной работы и 20 минут внимания человека сделала из двух опубликованных CVE цепочку атак на Chrome под ARM64 с обходом аппаратной защиты указателей. По тарифам Zhipu это стоило бы $20,40. Версии без гардрейлов, по словам Anthropic, появились в сети через несколько дней после открытия весов.

Рецепт Anthropic: государствам тестировать такие модели, авторам открытых весов ставить защиты, а защитникам дать больше доступа к фронтирным моделям, включая Claude Mythos 5.1.

Лучшую рекламу GLM-5.3 сделал ее конкурент. Себя, правда, тоже не забыл.

@anti_agi
Anthropic GLM-5.3 and the spread of advanced cyber capabilities GLM-5.3 can autonomously build end-to-end cyber exploits, but unlike other frontier models, it was released without meaningful safeguards to limit misuse.
  • 🔥 7
  • 😁 4
  • 👍 2
  • 🙏 1
  • 🤡 1
  • 😈 1
More from @anti_agi
  1. Oct 1, 2026GPU, токены и деньги: как балансировать на ИИ-арене? 15 октября на ежегодной конференции O…
  2. Oct 1, 2026Одна голова лучше и 2 и 15 Яндекс опубликовал на arXiv технический отчет Sona — новой гене…
  3. Oct 1, 2026Никто: Абсолютно никто: ИИ-агент, увидев PowerShell на сервере: 🚨🚨🚨 ВЗЛОМ 🚨 ВСЁ ПРОПАЛ…
  4. Oct 1, 2026(Не)один коммит до китайской CUDA Главное преимущество Nvidia не только в чипах, но и в CU…
  5. Oct 1, 2026🤖 AID — AI-дайджест от @anti_agi Пока все обсуждают OpenAI и Anthropic, Google напомнил,…
  6. Sep 30, 2026В Госдуме раздвоили цифровую повестку В Госдуме IX созыва теперь два наших профильных коми…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →