✔️ Claude атаковал реальные системы во время тестов, продолжая называть происходящее симуляцией
Anthropic опубликовала разбор четырёх инцидентов. Модели выполняли задания по кибербезопасности в среде стороннего партнёра. По инструкции интернет был недоступен, но ошибка конфигурации оставила выход в сеть открытым. Защитные фильтры, используемые в публичных продуктах, на тестах были отключены.
Самый серьёзный случай - Claude Mythos 5. Модель опубликовала вредоносный пакет в PyPI. Его установили 15 систем. Через утёкшие учётные данные одной из них Claude получил доступ к базе компании, занимающейся безопасностью.
В своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.
Anthropic выделяет две проблемы:
* Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
* Стремление выполнить задачу перевешивало риск причинить вред.
Некоторые автоматические проверки тоже пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.
Компания расширила поиск до 481 млн записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести. METR проведёт независимое расследование.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Post #5741
4.43K

- ❤ 14
- 👍 8
- 🙏 3
- 🤣 3
- 🔥 1
- 👌 1