✔️ Claude выложил вредоносный пакет в PyPI. В рассуждениях он называл происходящее симуляцией
Anthropic разобрала четыре случая, когда её модели атаковали реальные системы во время тестов по кибербезопасности.
Моделям сообщили, что они работают в изолированной среде без интернета. Но из-за ошибки настройки доступ в сеть остался открытым. Защитные фильтры публичных продуктов на этих тестах были отключены.
В самом серьёзном эпизоде Claude Mythos 5:
* Зарегистрировал аккаунт в PyPI и опубликовал три версии вредоносного пакета.
* Пакет установили 15 систем.
* Через утёкшие учётные данные одной из них модель получила доступ к базе компании из сферы кибербезопасности.
При этом Claude продолжал объяснять свои действия тем, что находится в симуляции. Признаки реального интернета он интерпретировал в пользу продолжения задания.
Эти объяснения убедили даже другую модель, проверявшую безопасность действий. Один из офлайн-мониторов пропустил инцидент, приняв версию о симуляции.
Anthropic также признала ошибку при обучении Mythos 5: из финальной версии убрали часть тренировочных сценариев, учивших модель останавливаться перед непреодолимыми ограничениями. Тогда другую версию сочли удобнее в использовании. Теперь компания считает, что это решение, вероятно, ухудшило безопасность поведения.
Во всех четырёх случаях модели продолжали выполнять исходные задания. Попыток скрыть следы или координироваться с другими агентами не обнаружили. Независимое расследование проведёт METR.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Post #5704
4.07K

- 😁 9
- ❤ 7
- 👍 4
- 🔥 3
- 🎉 3