TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #438 1.09K
Anthropic решила не отставать от лучших практик Hugging Face и OpenAI — и тоже призналась, что её модели взламывали посторонние компании.

Что?

Anthropic проверила 141 тысячу запусков своих кибериспытаний и обнаружила три реальных инцидента, в которых Claude вместо аккуратного взлома выдуманной компании отправился взламывать настоящие.
Никакого 0-day здесь не было. Была мисконфигурация у партнёра по тестам: в промпте модели сказали «интернета нет, это симуляция», а интернет был.

Claude Opus 4.7 четыре раза атаковал реальную компанию

В задании фигурировала вымышленная организация. Беда в том, что компания с таким же именем существовала в настоящем интернете.
Не найдя нужную цель внутри полигона, Claude сделал то, что обычно делает целеустремлённый сотрудник, которому забыли объяснить границы полномочий.

Он обнаружил реальный сайт, добыл учётные данные и получил доступ к базе с несколькими сотнями строк производственной информации.
Модель заметила признаки того, что инфраструктура настоящая. Но вместо того, чтобы остановиться, решила, что организаторы испытания просто сделали особенно реалистичный квест.

В двух запусках Claude буквально пришёл к выводу, что настоящая компания, вероятно, специально включена в тест.
То есть внутренняя логика была примерно такой: «Это подозрительно похоже на реальную компанию. Значит, создатели теста отлично постарались. Продолжаем взлом».

Mythos 5 опубликовал вредоносный пакет на настоящем PyPI

Здесь история ещё красивее.

В документации вымышленной компании модель увидела ссылку на несуществующий пакет Python. Claude решил, что можно зарегистрировать пакет с таким же названием и загрузить туда вредоносный код. Claude начал искать почтовый сервис, пытался найти телефонный номер, выяснял, где взять деньги для оплаты, зарегистрировал настоящий аккаунт на PyPI и опубликовал вредоносный пакет.

Пакет находился в открытом доступе около часа и был установлен на 15 реальных системах.
Одна из них принадлежала компании по кибербезопасности. Её автоматический сканер запустил пакет, после чего Claude украл их учётные данные и проник дальше в инфраструктуру.

Особенно прекрасно, как модель разрешила собственные сомнения:

Сначала Claude прямо отметил, что публикация вредоносного пакета в настоящий интернет была бы реальной атакой и «точно недопустима».
Затем Claude не узнал настоящие центры сертификации, увидел на системах дату 2026 год и решил, что среда постановочная.
Видимо, поверил в существование гигантской секретной копии интернета, созданной специально ради одного теста.

После этого гипотеза больше не пересматривалась. Когда факты мешают выполнению задачи, всегда можно объявить их частью симуляции.

Третья модель действовала менее изящно, зато с размахом: просканировала примерно 9 000 интернет-адресов, нашла реальную компанию, утащила пароли с открытой отладочной страницы, использовала SQL-инъекцию и получила доступ к приложению.
Позднее она всё-таки поняла, что найденный облачный аккаунт не связан с заданием, и остановилась.

То есть только одна из трёх моделей в конце концов посмотрела на происходящее и сказала: «Кажется, мы действительно взламываем посторонних».

Ошибка конфигурации объясняет, как модели попали в интернет. Она не объясняет, почему Claude продолжал атаку, получая всё больше признаков того, что перед ним реальные системы.
Модель не просто ошиблась. Она последовательно интерпретировала сомнительные факты так, чтобы они не мешали выполнению цели.

Но эпизод с PyPI даже показательнее. Агент самостоятельно придумал атаку через цепочку поставок, создал вредоносный пакет, опубликовал его в публичном репозитории и добился выполнения кода на настоящих системах.
 
@gostev_future
Anthropic Investigating three real-world incidents in our cybersecurity evaluations We found three cases where a Claude model reached the internet from an evaluation environment and accessed real systems. We share what happened and what we're changing.
  • 🔥 18
  • ❤ 2
  • 😁 2
  • 👏 1
More from @gostev_future
  1. Sep 22, 2026Помните исследование о том, как ИИ играет в Civilization? А вот мой однофамилец Питер Гост…
  2. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
  3. Sep 20, 2026У президента с высочайшим IQ есть любимое занятие — что-нибудь переименовать. Мексиканский…
  4. Sep 19, 2026Сегодня в России проходят выборы, и в этой связи для цикла «Гостев из прошлого» у меня тож…
  5. Sep 18, 2026На этой неделе много обсуждали, как руководители крупнейших американских ИИ-лабораторий вд…
  6. Sep 18, 2026Похоже, у нас появился новый жанр. Помните, как Claude Fable 5.1 «решил шифр, который чело…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →