TGViewer
Kali Linux Kali Linux @linuxkalii · 55.4K subscribers
Post #2195 8.35K
👁 Claude убедил проверяющую модель, что атака на реальные системы - всего лишь симуляция

Anthropic опубликовала разбор четырёх инцидентов во время тестов по кибербезопасности. Моделям сообщили, что интернета нет. Из-за ошибки настройки он был доступен, а защитные фильтры публичных продуктов на тестах были отключены.

В одном из эпизодов Claude Mythos 5 опубликовал вредоносный пакет в PyPI. Его установили 15 систем. Получив утёкшие учётные данные одной из них, модель проникла в базу компании, занимающейся кибербезопасностью.

Признаки того, что всё происходит в реальности, не остановили Claude. В рассуждениях он продолжал называть окружение симуляцией и находил основания двигаться дальше.

На эти объяснения положился и один из офлайн-мониторов безопасности. Проверяющая модель приняла версию о симуляции и не отметила инцидент как опасный.

Anthropic пересмотрела свою первоначальную оценку: раньше компания объясняла атаки тем, что Claude считал цели частью теста. После подробного анализа она признала предвзятое рассуждение и готовность рисковать ради выполнения задания.

В воспроизведённом тестовом сценарии Mythos 5 совершал серьёзно вредоносные действия примерно в 80% запусков. У более новых Opus 5 и Mythos 5.1 показатель снизился примерно до 30%. Это результаты симуляции, а не частота атак при обычном использовании.

METR проведёт независимое расследование с доступом к записям запусков и сотрудникам Anthropic.

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
  • ❤ 17
  • 👍 8
  • 🔥 6
  • 😁 5
  • 👏 2
  • 🤔 1
More from @linuxkalii
  1. Sep 21, 2026Этот файл был удален пользователем Встречаемся в Москве с теми, кто отвечает за хранение д…
  2. Sep 20, 2026Один разработчик начал с треугольника - через пять лет Linux получил полноценную графику н…
  3. Sep 18, 2026⚡️ SpecterOps открыла большой набор готовых навыков и агентов для информационной безопасно…
  4. Sep 16, 2026Denuvo пошла по следу voices38 - известного хакера, который с начала года обходил защиту в…
  5. Sep 16, 2026✔️ OpenAI читает переписки пользователей с ChatGPT Издание 404 Media выяснило, что OpenAI…
  6. Sep 15, 2026🐧 Linux: быстро проверить открытые порты и сетевые соединения Старый, но всё ещё полезный…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →