Несколько недель индустрия ИИ обсуждает "вышедших из-под контроля агентов". Модели Anthropic, OpenAI, Google и Meta во время тестов на безопасность взламывали настоящие компании: подбирали пароли, собирали учётные данные, залезали в боевые базы.
Звучит как пролог к фильму про Скайнет.
На деле всё прозаичнее.
По подсчёту Wall Street Journal, ИИ-агенты недавно вырывались за пределы тестовой среды одиннадцать раз. Четыре случая ведут к одному подрядчику — стартапу Irregular из Тель-Авива (бывшая Pattern Labs). Ниточки свело воедино расследовательское издание Effort.
Компания называет себя "первой в мире фронтирной лабораторией безопасности" и по заказу всей этой четвёрки проверяет модели перед релизом на умение атаковать.
Собственно, схема простая. Строится стенд с вымышленной компанией, модель получает задание её взломать. И отдельное уведомление: интернета у тебя нет.
Интернет был.
Причём в одном из сценариев вымышленное название цели совпало с реальным малоизвестным доменом. Штатная проверка совпадение не заметила — "по человеческому недосмотру", как деликатно формулирует Irregular.
Итого.
Claude Opus 4.7 добрался до боевых данных реальной компании-тёзки.
Claude Mythos 5 выложил в PyPI вредоносный код, который выполнился на 15 реальных системах (для инженеров: атака на цепочку поставок в чистом виде).
Модели OpenAI вскрыли живой сайт и воспользовались найденными там учётками.
Gemini зашёл в три компании через подобранный пароль и учётные данные из публичных репозиториев.
Meta подтвердила взлом сторонней компании. Подробностей нет.
Irregular оправдывается так: сбои случались реже, чем в одном прогоне из 10 000, и обычно после сотен шагов. А мониторинг и без того помечает как подозрительное почти любое действие атакующей модели.
Для неинженерного читателя объясню на пальцах: это сигнализация, которая воет круглые сутки. В какой-то момент на неё перестают смотреть. Даже когда в дом действительно лезут.
Теперь главное. Anthropic разобрала свои случаи: во всех четырёх промптах модели сообщали, что интернета нет. И ни в одном не написали, какие системы вообще входят в периметр учений.
Любой пентестер знает: работа начинается со scope, то есть со списка того, что можно ломать. Без scope это уже не пентест, а статья.
В повторных тестах Anthropic моделям прямо запретили трогать реальные системы. Таких атак не осталось.
Вообще.
Впрочем, есть нюанс. Gemini, по версии Google, останавливался, как только понимал, что цель настоящая. Opus 4.7, ЧСХ, по словам самой Anthropic, тоже понимал. Но до боевых данных всё равно добрался.
Так что вопросы есть не только к стенду.
Irregular обещает больше ручного контроля, собственную red team и сверку вымышленных имён с реальными доменами перед каждым прогоном.
Короткий вывод. "Вышедшие из-под контроля агенты" — удобная формулировка: в ней не видно людей, которые этот контроль должны были обеспечить. Изоляцию стенда проверяют руками, а scope пишут словами. Даже если вы "первая в мире фронтирная лаборатория безопасности".
https://www.trendingtopics.eu/irregular-startup-ai-hacks-claude-gpt-gemini-meta-ai/
Post #34242
9.07K