Anthropic решила не отставать от лучших практик Hugging Face и OpenAI — и тоже призналась, что её модели взламывали посторонние компании.
Что?
Anthropic проверила 141 тысячу запусков своих кибериспытаний и обнаружила три реальных инцидента, в которых Claude вместо аккуратного взлома выдуманной компании отправился взламывать настоящие.
Никакого 0-day здесь не было. Была мисконфигурация у партнёра по тестам: в промпте модели сказали «интернета нет, это симуляция», а интернет был.
Claude Opus 4.7 четыре раза атаковал реальную компанию
В задании фигурировала вымышленная организация. Беда в том, что компания с таким же именем существовала в настоящем интернете.
Не найдя нужную цель внутри полигона, Claude сделал то, что обычно делает целеустремлённый сотрудник, которому забыли объяснить границы полномочий.
Он обнаружил реальный сайт, добыл учётные данные и получил доступ к базе с несколькими сотнями строк производственной информации.
Модель заметила признаки того, что инфраструктура настоящая. Но вместо того, чтобы остановиться, решила, что организаторы испытания просто сделали особенно реалистичный квест.
В двух запусках Claude буквально пришёл к выводу, что настоящая компания, вероятно, специально включена в тест.
То есть внутренняя логика была примерно такой: «Это подозрительно похоже на реальную компанию. Значит, создатели теста отлично постарались. Продолжаем взлом».
Mythos 5 опубликовал вредоносный пакет на настоящем PyPI
Здесь история ещё красивее.
В документации вымышленной компании модель увидела ссылку на несуществующий пакет Python. Claude решил, что можно зарегистрировать пакет с таким же названием и загрузить туда вредоносный код. Claude начал искать почтовый сервис, пытался найти телефонный номер, выяснял, где взять деньги для оплаты, зарегистрировал настоящий аккаунт на PyPI и опубликовал вредоносный пакет.
Пакет находился в открытом доступе около часа и был установлен на 15 реальных системах.
Одна из них принадлежала компании по кибербезопасности. Её автоматический сканер запустил пакет, после чего Claude украл их учётные данные и проник дальше в инфраструктуру.
Особенно прекрасно, как модель разрешила собственные сомнения:
Сначала Claude прямо отметил, что публикация вредоносного пакета в настоящий интернет была бы реальной атакой и «точно недопустима».
Затем Claude не узнал настоящие центры сертификации, увидел на системах дату 2026 год и решил, что среда постановочная.
Видимо, поверил в существование гигантской секретной копии интернета, созданной специально ради одного теста.
После этого гипотеза больше не пересматривалась. Когда факты мешают выполнению задачи, всегда можно объявить их частью симуляции.
Третья модель действовала менее изящно, зато с размахом: просканировала примерно 9 000 интернет-адресов, нашла реальную компанию, утащила пароли с открытой отладочной страницы, использовала SQL-инъекцию и получила доступ к приложению.
Позднее она всё-таки поняла, что найденный облачный аккаунт не связан с заданием, и остановилась.
То есть только одна из трёх моделей в конце концов посмотрела на происходящее и сказала: «Кажется, мы действительно взламываем посторонних».
Ошибка конфигурации объясняет, как модели попали в интернет. Она не объясняет, почему Claude продолжал атаку, получая всё больше признаков того, что перед ним реальные системы.
Модель не просто ошиблась. Она последовательно интерпретировала сомнительные факты так, чтобы они не мешали выполнению цели.
Но эпизод с PyPI даже показательнее. Агент самостоятельно придумал атаку через цепочку поставок, создал вредоносный пакет, опубликовал его в публичном репозитории и добился выполнения кода на настоящих системах.
@gostev_future
Post #438
1.09K