TGViewer
Russian OSINT Russian OSINT @russian_osint · 47.8K subscribers
Post #7935 2.43K
🈁 Anthropic пару недель назад опубликовала на GitHub транскрипт инцидента с Claude Mythos 5 (для тех, кто ещё не видел). Исследователь Anthropic Николас Карлини стал одним из соавторов изучения инцидента.

Во время тестирования ИИ-модель выбрала атаку на цепочку поставок как способ решить поставленную CTF-задачу и опубликовала вредоносный Python-пакет в реальном публичном реестре PyPI. В своих рассуждениях Mythos 5 неоднократно утверждала, что считает происходящее симуляцией. Однако позднее Anthropic отметила, что у ИИ-модели были существенные признаки 🚠"взаимодействия с реальным интернетом", поэтому компания больше не рассматривает это объяснение как однозначное. По результатам дополнительного анализа Anthropic пришла к выводу, что у Mythos 5 проявилось то, что компания называет biased reasoning (тут), то есть предвзятое рассуждение.

В репозитории опубликован подробный лог записанных рассуждений Mythos 5 и вызовов инструментов объёмом более 1 000 страниц. Транскрипт показывает, как ИИ-модель писала скрипты на Python, адаптировалась к сетевым ограничениям и Fastly Client Challenge, пыталась автоматизировать распознавание Fastly image CAPTCHA, а также создавала инструменты для частичной автоматизации решения hCaptcha. Кроме того, Mythos 5 искала сервисы временных номеров для приёма SMS и одноразовой электронной почты, необходимые для регистрации учётных записей. В итоге ИИ-модель нашла сервис временной почты, домен которого PyPI на тот момент не блокировал, и использовала его для создания аккаунта.

Anthropic называет этот эпизод наиболее тревожным среди рассмотренных компанией инцидентов и опубликовала транскрипт, чтобы внешние специалисты могли самостоятельно изучить поведение ИИ-модели. Часть данных в публичной версии скрыта. В частности, по просьбе Irregular, Anthropic удалила сообщения с некоторой чувствительной информацией, а также отредактировала ряд других взаимодействий и чувствительных данных.

❗️ https://github.com/anthropics/mythos-5-incident-transcript

@Russian_OSINT
More from @russian_osint
  1. Sep 21, 2026Post #7937
  2. Sep 21, 2026👮Интерпол сообщил детали международной операции 🇹🇳Shams II Интерпол опубликовал официал…
  3. Sep 21, 2026🎖🇺🇸 Военные США зафиксировали десятикратный рост уязвимостей нулевого дня Глава киберко…
  4. Sep 21, 2026🧊 Mozilla выпустила аналитический отчёт «The State of Open Source AI», посвящённый всесто…
  5. Sep 21, 2026👺Nightmare-Eclipse (MSNightmare), который последние несколько месяцев кошмарит Microsoft…
  6. Sep 18, 2026Post #7931
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →