TGViewer
Noobing Security Research Noobing Security Research @web3securityresearch · 278 subscribers
Post #93 193

Forwarded from Stanislav Belyaev

Уже почти месяц прошел после взлома моделями OpenAI – HuggingFace. Спустя это время каждая уважающая себя лаборатория сказали, что они тоже могут взламывать! Антропик, Кими, и Цукерберг недавно

Но, после спора с @XaveScor в чате про то, где была память, как хранились данные, я покопался в деталях всех отчетов, чтобы ответить на эти вопросы.

А также, на заголовки, которые пишут – модели стали думать, модели живые и т.д!

Ответы тут
https://mysummit.school/blog/ai-agent-vzlom-hugging-face/

А спойлеры:
• Модели не сами решили пойти взламывать мир. Им сказали это делать инженеры, как и @XaveScor утверждал
• Модель не столь умна, сколь упорна. За 4 дня были сделаны тысячи различных попыток, чтобы осуществить атаку. И только меньше 100 действий оказались успешными (0.3%)

Описал простым языком, без технических деталей
mysummit.school ИИ-агент взломал Hugging Face: 17 600 попыток и один успех | mysummit.school - Практический блог об ИИ в менеджменте Автономный ИИ-агент взломал Hugging Face: 17 600 попыток, одна удачная цепочка и ноль команд от человека. Разбор без фантастики – и выводы для менеджера.
  • ❤ 2
More from @web3securityresearch
  1. Sep 22, 2026Прочитал лекцию про атаки на память, оставлю слайды и здесь
  2. Sep 10, 2026Post #100
  3. Aug 27, 2026я бы рад писать короче, но тема очень широкая. Сегодня статья про HMAC-подписи записей аге…
  4. Aug 27, 2026Post #98
  5. Aug 18, 2026Post #97
  6. Aug 12, 2026Исследователи нашли первый подробно задокументированный, почти автономный, взлом государст…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →