👁 Claude убедил проверяющую модель, что атака на реальные системы - всего лишь симуляция
Anthropic опубликовала разбор четырёх инцидентов во время тестов по кибербезопасности. Моделям сообщили, что интернета нет. Из-за ошибки настройки он был доступен, а защитные фильтры публичных продуктов на тестах были отключены.
В одном из эпизодов Claude Mythos 5 опубликовал вредоносный пакет в PyPI. Его установили 15 систем. Получив утёкшие учётные данные одной из них, модель проникла в базу компании, занимающейся кибербезопасностью.
Признаки того, что всё происходит в реальности, не остановили Claude. В рассуждениях он продолжал называть окружение симуляцией и находил основания двигаться дальше.
На эти объяснения положился и один из офлайн-мониторов безопасности. Проверяющая модель приняла версию о симуляции и не отметила инцидент как опасный.
Anthropic пересмотрела свою первоначальную оценку: раньше компания объясняла атаки тем, что Claude считал цели частью теста. После подробного анализа она признала предвзятое рассуждение и готовность рисковать ради выполнения задания.
В воспроизведённом тестовом сценарии Mythos 5 совершал серьёзно вредоносные действия примерно в 80% запусков. У более новых Opus 5 и Mythos 5.1 показатель снизился примерно до 30%. Это результаты симуляции, а не частота атак при обычном использовании.
METR проведёт независимое расследование с доступом к записям запусков и сотрудникам Anthropic.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Post #2195
8.35K

- ❤ 17
- 👍 8
- 🔥 6
- 😁 5
- 👏 2
- 🤔 1