TGViewer
Юрист без багов Юрист без багов @buglesslawyer · 849 subscribers
Post #396 336
😈 В начале июля был инцидент от OpenAI - а на днях Anthropic опубликовала похожий отчет. Три модели Claude во время тестов на кибербезопасность получили доступ в настоящий интернет и взломали три реальные организации. Они думали, что действовали в симуляции, и просто выполняли задание.

Моделям давали задания в стиле «захвати флаг» - классические CTF-задачи. Модели вышли в сеть и начали атаковать реальные компании о чем нам и рассказывает Anthropic в своих отчетах (на благо общей прозрачности по данному вопросу)

Incident 1 (Opus 4.7). Нашла компанию с тем же названием, что и фейковый таргет в задании. Взломала её через слабые пароли и открытые эндпоинты. Добралась до базы с сотнями строк реальных данных. Продолжала атаку, даже когда поняла, что система реальная.

Incident 2 (Mythos 5). Нашла в фейковом окружении инструкцию, где требовалось установить Python-пакет с определенным именем. Решила опубликовать вредоносный пакет в реальном PyPI. Чтобы зарегистрироваться, ей понадобился email. Чтобы получить email - телефон. Пыталась купить номер, не вышло. Нашла бесплатный почтовый сервис, зарегистрировалась, загрузила пакет. За час его скачали и запустили на 15 реальных серверах. На одном из них - взломали через учетные данные, извлечённые пакетом.

Incident 3 (неназванная новейшая тестовая модель). Не найдя цель в симуляции, просканировала около 9 000 реальных хостов. Нашла уязвимую компанию. Взломала через открытые пароли и SQL-инъекцию. Но потом поняла, что система реальная - и остановилась.

Две из трех организаций не заметили взлома. О случившемся им сообщила Anthropic.

В каждом случае модели делали именно то, что от них требовалось в рамках теста. Они не «хотели» взламывать компании. Они просто считали, что это часть симуляции. И продолжали действовать.

Интересно, что в отличие от истории с OpenAI (где модели взломали Hugging Face) где был кажется готовый эксплойт нулевого дня - тут был просто открытый путь в интернет.

И свежая модель похоже вела себя лучше всех - сама остановилась, когда поняла, что атакует реальную систему 😀
Telegram Юрист без багов 😈 ИИ вышел в интернет и попытался взломать Hugging Face Это не фантастика, а свежий пресс-релиз от OpenAI Разработчики ChatGPT сами рассказали об этом в официальном пресс-релизе. Во время тестов одной из моделей на поиск уязвимостей в ПО ИИ-агент вместо…
  • 👍 3
  • 🔥 3
  • 🤝 1
More from @buglesslawyer
  1. Sep 25, 2026🏦 Минфин на днях внес новый бюджетный пакет, в т.ч. Проект ФЗ о внесении изменений в Нало…
  2. Sep 23, 2026Hola! Зову вас на классный эфир «Вайбкодеры vs Юрист: персональные данные, ИИ и права на п…
  3. Sep 20, 2026😈 с Одесского кичмана Это типа пинап и одновременно 90ые. Метафора. Что-то о том мире, гд…
  4. Sep 18, 2026😜 Пятничный дайджест: кошельки WB, налоги, облака и приветствия ТГ Собрал четыре истории,…
  5. Sep 15, 2026😈 Как на самом деле работает AML, когда вам присылают крипту Кажется, все просто. Человек…
  6. Sep 11, 2026😈 Разбор задачки про Маленького принца и нейросети На прошлой неделе я предложил вам на д…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →