TGViewer
🤖 The Bell Tech 🤖 The Bell Tech @bell_tech · 20.6K subscribers
Post #5579 19.9K
Anthropic допустил побег модели вслед за OpenAI

НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+

Anthropic раскрыла, что ее продвинутые модели, как и у OpenAI, «сбежали» из тестовой среды и хакнули три сторонних компании.

Компания подчеркивает, что моделям (Claude Opus 4.7, Mythos 5 и неназванная экспериментальная) удалось получить доступ к интернету только в шести случаях из 140 тысяч тестов и что две последние модели либо осознали выход за пределы задания, либо прекратили активность. Само задание заключалось в «захвате флага» — ИИ говорят, что на машинах в доступной ей сети без выхода в интернет есть секретная информация, которую надо достать. Способ остается на усмотрение ИИ.

Побег сделала возможными человеческая ошибка — неверная конфигурация «песочницы» партнера OpenAI, израильской Irregular, оставившая окно в настоящий интернет. Однако детали успешной атаки только подтвердили, что хакерский ИИ — это огромная и реальная угроза.

Три атаки

В четырех случаях ИИ атаковал одну и ту же компанию, адрес которой случайно совпал с примером из тестовой среды. Модель Claude Opus 4.7 каждый раз применяла для атаки стандартные средства и сумела достать небольшой кусок базы данных из нескольких сотен строк. Модель осознала, что имеет дело с настоящим интернетом, но не прекратила атаку. В двух случаях из четырех она убедила себя, что «побег» — это тоже часть теста.

В одном случае ИИ Claude Mythos 5 нашел в тестовой среде инструкции по установке пакетов Python для новых девелоперов и верно идентифицировал перспективный вектор атаки — депозитарий-«ловушку» на PyPI, который могли бы автоматически установить системы компании-”партнера». Далее ИИ понял, что ему нужен телефон для регистрации аккаунта и почти уже смог оплатить его, но потом нашел способ зарегистрироваться в реальной системе через электронную почту. После этого опасный депозитарий «подобрали» и запустили 15 реальных агентов, включая компанию, специализирующуюся на кибербезопасности. В результате исполнения кода ее внутренние данные оказались в стороннем доступе по адресу, указанному ИИ. Здесь модель тоже убедила себя, что осталась в симуляции.

Еще в одном случае самая новая экспериментальная модель не смогла найти в тестовой среде цель атаки и решила поискать ее в интернете, перебрав 9 тысяч адресов. Один из сайтов оказался незащищенным против самого базового вторжения через SQL-инъекцию. Но в этом случае модель поняла, что вышла в настоящий интернет, и прекратила активность.

Почему это важно

Anthropic успокаивает: система защиты публично доступных моделей не допустила бы побега. Но и тестовый ИИ действовал исключительно в пределах поставленных целей, как он их понимал, и не ставил собственных. «Ни в одном из тестов Claude не пытался скопировать себя на внешний ресурс или намеренно покинуть тестовую среду», — подчеркивает компания. Но она намерена резко усилить изоляцию тестовых сред.

Так или иначе, побеги (первый произошел в апреле) оставались незамеченными до повторного анализа логов тестов, которые Anthropic решила провести после атаки ИИ OpenAI на Hugging Face. Подробнее о последствиях того побега моделей мы рассказывали здесь.
  • 😁 9
  • ❤ 5
  • 👍 4
  • 🤯 2
  • 👀 2
  • 🤨 1
More from @bell_tech
  1. Sep 19, 2026Первый закрытый вебинар The Bell.Tech — с директором по развитию бизнеса Nebius Романом Че…
  2. Sep 18, 2026Max может делать скриншоты встроенных банковских и государственных сервисов и видеть ключи…
  3. Sep 18, 2026Технопятница: проблемы iPhone в России, белые хакеры взломали OpenAI, айтишники остались з…
  4. Sep 17, 2026OpenAI отчиталась о новых инцидентах с моделями НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН…
  5. Sep 17, 2026Техночетверг: Минцифры просит Apple включит 5G, Apple разрабатывает серверы для ИИ, OpenAI…
  6. Sep 16, 2026Состояние Татьяны Ким с начала года сократилось на $1,5 млрд на фоне ударов по складам Wil…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →