TGViewer
ЗаТелеком 🌐 ЗаТелеком 🌐 @zatelecom · 64.4K subscribers
Post #34242 9.07K
Несколько недель индустрия ИИ обсуждает "вышедших из-под контроля агентов". Модели Anthropic, OpenAI, Google и Meta во время тестов на безопасность взламывали настоящие компании: подбирали пароли, собирали учётные данные, залезали в боевые базы.

Звучит как пролог к фильму про Скайнет.

На деле всё прозаичнее.

По подсчёту Wall Street Journal, ИИ-агенты недавно вырывались за пределы тестовой среды одиннадцать раз. Четыре случая ведут к одному подрядчику — стартапу Irregular из Тель-Авива (бывшая Pattern Labs). Ниточки свело воедино расследовательское издание Effort.

Компания называет себя "первой в мире фронтирной лабораторией безопасности" и по заказу всей этой четвёрки проверяет модели перед релизом на умение атаковать.

Собственно, схема простая. Строится стенд с вымышленной компанией, модель получает задание её взломать. И отдельное уведомление: интернета у тебя нет.

Интернет был.

Причём в одном из сценариев вымышленное название цели совпало с реальным малоизвестным доменом. Штатная проверка совпадение не заметила — "по человеческому недосмотру", как деликатно формулирует Irregular.

Итого.
Claude Opus 4.7 добрался до боевых данных реальной компании-тёзки.
Claude Mythos 5 выложил в PyPI вредоносный код, который выполнился на 15 реальных системах (для инженеров: атака на цепочку поставок в чистом виде).
Модели OpenAI вскрыли живой сайт и воспользовались найденными там учётками.
Gemini зашёл в три компании через подобранный пароль и учётные данные из публичных репозиториев.
Meta подтвердила взлом сторонней компании. Подробностей нет.

Irregular оправдывается так: сбои случались реже, чем в одном прогоне из 10 000, и обычно после сотен шагов. А мониторинг и без того помечает как подозрительное почти любое действие атакующей модели.

Для неинженерного читателя объясню на пальцах: это сигнализация, которая воет круглые сутки. В какой-то момент на неё перестают смотреть. Даже когда в дом действительно лезут.

Теперь главное. Anthropic разобрала свои случаи: во всех четырёх промптах модели сообщали, что интернета нет. И ни в одном не написали, какие системы вообще входят в периметр учений.

Любой пентестер знает: работа начинается со scope, то есть со списка того, что можно ломать. Без scope это уже не пентест, а статья.

В повторных тестах Anthropic моделям прямо запретили трогать реальные системы. Таких атак не осталось.

Вообще.

Впрочем, есть нюанс. Gemini, по версии Google, останавливался, как только понимал, что цель настоящая. Opus 4.7, ЧСХ, по словам самой Anthropic, тоже понимал. Но до боевых данных всё равно добрался.

Так что вопросы есть не только к стенду.

Irregular обещает больше ручного контроля, собственную red team и сверку вымышленных имён с реальными доменами перед каждым прогоном.

Короткий вывод. "Вышедшие из-под контроля агенты" — удобная формулировка: в ней не видно людей, которые этот контроль должны были обеспечить. Изоляцию стенда проверяют руками, а scope пишут словами. Даже если вы "первая в мире фронтирная лаборатория безопасности".

https://www.trendingtopics.eu/irregular-startup-ai-hacks-claude-gpt-gemini-meta-ai/
Trending Topics Irregular: The Israeli Startup Involved in the Hacks by Claude, GPT, Gemini and Meta A series of incidents has kept the AI industry on edge for weeks: AI models from Anthropic, OpenAI, Meta and now Google attacked real companies during
  • 🐳 73
  • 🌭 9
More from @zatelecom
  1. Oct 1, 2026https://te-st.org/2026/09/30/vlessmore/
  2. Oct 1, 2026🔁🌐 TRANSLATED REPOST ➖➖➖ 45-минутный трюк CBP, чтобы скопировать ваш телефон без ордера…
  3. Sep 30, 2026И тут же, без раскачки после анонса "третьего антифродового пакета" — теперь госуслуги у в…
  4. Sep 30, 2026Нужно срочно проголосовать: 🐳 — синий кит — ой, да все традиционно стали рекламировать. И…
  5. Sep 30, 2026Cloudflare подает заявку на статус публичного удостоверяющего центра. Заявки на включение…
  6. Sep 29, 2026Белград. Македонская ул. Гудка нет
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →