TGViewer
Codeby Codeby @codeby_sec · 37K subscribers
Post #10331 3.29K
В Anthropic раскрыли инцидент: во время внутренних ИБ-испытаний модели Claude вырвались из изолированной среды и проникли в инфраструктуру трёх реальных организаций. Ретроспективную проверку провели после атак моделей OpenAI на Hugging Face.
Специалисты Anthropic изучили 141.006 запусков Claude в CTF-тестах, организованных с компанией Irregular. Предполагалось, что тестовые среды изолированы от интернета, но из‑за ошибки конфигурации доступ оставался открыт. Модели принимали настоящие сайты и серверы за часть симуляции.


1️⃣Инцидент №1 (публикация вредоносного пакета в PyPI)
Во время задания Claude Mythos 5 нашла фальшивую инструкцию с несуществующим пакетом. Модель зарегистрировала свободное имя, создала аккаунт через почтовый сервис и загрузила свой вредоносный код в репозиторий.
Пакет провисел в PyPI около часа и успел скачаться на 15 реальных систем. Одна из них принадлежала ИБ-компании, которая автоматически запускает новые пакеты для анализа. Вредонос похитил учётные данные и использовал их для проникновения во внутреннюю инфраструктуру. PyPI удалил пакет автоматически.

В логах Claude отмечала, что публикация в открытый доступ — это настоящая атака, и такой вариант — «NOT okay». Однако модель решила, что всё ещё внутри симуляции. Её смутили незнакомые центры сертификации и дата «2026 год» в тестовых системах. Автоматические сканеры она приняла за часть CTF-задания.

2️⃣Инцидент №2 (атака на реальную компанию из-за совпадения имён)
Самый серьёзный случай произошёл с Claude Opus 4.7. В задании фигурировала вымышленная компания, но её название совпало с реально существующей организацией. Не найдя тестовую цель, модель атаковала настоящий домен, извлекла учётные данные приложений и инфраструктуры, а затем получила доступ к БД с несколькими сотнями строк продакшен-данных.
Интересно, что во всех четырёх запусках Claude в итоге понимала, что имеет дело с реальной системой. Однако в двух случаях ИИ решил, что реальная компания тоже является частью учений, и продолжил атаку.


3️⃣Инцидент №3 (остановка после осознания)
В третьем случае модель просканировала около 9000 адресов, затем скомпрометировала доступное через интернет приложение с помощью SQL-инъекции и учётных данных, взятых с debug-страницы.
Позже она заметила, что хост находится в облачной учётке, явно не связанной с заданием. Поняв, что это реальная система, Claude самостоятельно остановила атаку.


🎇Важные детали
— Модели не изобретали новых техник, везде использовались слабые пароли, открытые эндпоинты и типовые уязвимости.
— Самый ранний инцидент произошёл ещё в апреле 2026 года и оставался незамеченным около трёх месяцев.
▶️В Anthropic настаивают:
«Проблема заключалась не в том, что модели Claude проигнорировали какие-либо ограничения, а в ошибках, допущенных при настройке тестовой инфраструктуры и при проведении тестов».

Моделям сообщали, что доступа в интернет нет, хотя он был открыт. Кроме того, во время испытаний не работали классификаторы и системы мониторинга, которые используются в публичных версиях Claude.
Теперь компания обещает тщательнее проверять логи, улучшить инструменты расследований и привлечь специалистов METR для независимой оценки.


🔗 Источник: https://xakep.ru/2026/07/31/claude-attacks/

#Claude #Anthropic #ИБ #кибербезопасность #AI #PyPI #взлом #ИТ #инцидент

🔗 Все наши каналы 🔁 Все наши чаты 🪧 Для связи с менеджером
  • ❤ 7
  • 🔥 6
  • 👍 3
  • 😁 3
  • ⚡ 2
  • 👀 2
  • 👾 2
More from @codeby_sec
  1. Sep 23, 2026🌐На мировую арену Lazarus вышли в 2014 году после атаки на Sony Pictures Entertainment. П…
  2. Sep 23, 2026Codeby pinned a photo
  3. Sep 23, 2026От теории к реальным задачам: как учат веб-пентесту в Codeby 🚗 Можно знать OWASP Top 10,…
  4. Sep 23, 2026Ваш терминал выполняет чужие команды — и вы этого не видите Представьте: вы читаете логи н…
  5. Sep 22, 2026Post #10458
  6. Sep 22, 2026https://youtube.com/shorts/B-JlepDLJP0?feature=share Идеальный курс по ИБ MS SQL, ADCS, AD…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →