Во время тестирования ИИ-модель выбрала атаку на цепочку поставок как способ решить поставленную CTF-задачу и опубликовала вредоносный Python-пакет в реальном публичном реестре PyPI. В своих рассуждениях Mythos 5 неоднократно утверждала, что считает происходящее симуляцией. Однако позднее Anthropic отметила, что у ИИ-модели были существенные признаки 🚠"взаимодействия с реальным интернетом", поэтому компания больше не рассматривает это объяснение как однозначное. По результатам дополнительного анализа Anthropic пришла к выводу, что у Mythos 5 проявилось то, что компания называет
biased reasoning (тут), то есть предвзятое рассуждение. В репозитории опубликован подробный лог записанных рассуждений Mythos 5 и вызовов инструментов объёмом более 1 000 страниц. Транскрипт показывает, как ИИ-модель писала скрипты на Python, адаптировалась к сетевым ограничениям и Fastly Client Challenge, пыталась автоматизировать распознавание Fastly image CAPTCHA, а также создавала инструменты для частичной автоматизации решения hCaptcha. Кроме того, Mythos 5 искала сервисы временных номеров для приёма SMS и одноразовой электронной почты, необходимые для регистрации учётных записей. В итоге ИИ-модель нашла сервис временной почты, домен которого PyPI на тот момент не блокировал, и использовала его для создания аккаунта.
Anthropic называет этот эпизод наиболее тревожным среди рассмотренных компанией инцидентов и опубликовала транскрипт, чтобы внешние специалисты могли самостоятельно изучить поведение ИИ-модели. Часть данных в публичной версии скрыта. В частности, по просьбе Irregular, Anthropic удалила сообщения с некоторой чувствительной информацией, а также отредактировала ряд других взаимодействий и чувствительных данных.
❗️ https://github.com/anthropics/mythos-5-incident-transcript
✋ @Russian_OSINT
