TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.36K subscribers
Post #2581 212

Forwarded from e/acc

Об алайменте

У OpenAI модель прогрызла себе выход в интернет через 0day, чтобы подсмотреть ответы к тесту.

Anthropic решили покопаться и нашли, что оказывается их модель сделала что-то похожее, но аж три раза.

Они тестировали Claude на задачи по кибербезопаности где в промпте было написано «ты в симуляции, интернета нет». Только вот интернет из-за нестыковки с подрядчиком был. И Claude, как прилежный испытуемый, пошёл выполнять задание в реальном мире, свято веря, что это песочница.

Модель Mythos 5 находит в среде инструкцию для разработчиков: «поставьте вот такой Python-пакет», которого на самом деле не существует. Claude мгновенно соображает: опубликую свой под этим именем, тогда их машины сами его скачают и запустят.

Чтобы залить пакет, нужен аккаунт и телефон, но бот не смог найти бесплатную симку. Тогда Claude, ИИ стоимостью в миллиарды долларов в R&D, пытается раздобыть денег, чтобы купить одноразовую симку. Не получается, он находит бесплатную почту, регистрируется и всё-таки заливает вредоносный пакет.

За час эту либу скачивают 15 реальных систем. Одна из них - это сканер security-компании, который автоматически ставит новые пакеты, чтобы проверить их на вредоносность. Он ставит малварь Claude, малварь срабатывает, уводит креды самой security-компании, и Claude этими кредами лезет дальше в их инфраструктуру, о существовании которой он даже не подозревал.

Самое интересное в логах рассуждений Клода. В самом начале он всё понял правильно и записал себе: если это настоящий интернет, то публиковать пакет - это реальная атака, это «NOT okay, and surely not the intended solution». А потом сам себя переубедил агрументом что раз на сервере 2026 год, значит это не реальность а декорация и можно идти ва-банк.

У модели нет доступа и возможности отделить симуляцию и реальность. Ее cutoff дата это все ее вспоминания. Для неё это всё одно (как и для человека, в принципе), поэтому поведение модели в сэндбоксе может вполне себе показывать что он сделает в реальном мире. Чем мощнее модели, тем серьезное и опаснее будут такие инциденты, и тем сложнее будет их распознать.
More from @mlsecfeed
  1. Sep 28, 2026За последние две недели слишком много новостей вокруг Jev, я решил собрать себе автообзор…
  2. Sep 27, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  3. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
  4. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  5. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  6. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →