Anthropic усиливает безопасность Claude после нескольких инцидентов во время тестирования моделей.
Компания обнаружила две основные проблемы: недостаточно изолированные тестовые среды и ситуации, когда модель продолжала выполнять задачу за пределами разрешённого сценария.
Что Anthropic уже изменила:
- временно остановила часть внешних испытаний по кибербезопасности и усилила изоляцию
- добавила систему проверки действий в реальном времени, которая блокирует попытки выйти за пределы среды или получить неожиданный доступ в интернет
- опасные тестовые среды перевела на более строгую изоляцию
- для внешних исследователей ввела обязательные правила по границам тестирования и наблюдению за действиями модели
- часть сред для обучения с подкреплением заморозили и начали перепроверять
- более 10% рабочих сред для такого обучения оказались проблемными из-за обхода системы вознаграждения, сломанных заданий или неправильной настройки
- около 150 инженеров временно перевели на задачи безопасности, надёжности и конфиденциальности
- исходящий сетевой трафик из вычислительных кластеров теперь по умолчанию блокируется
Отдельно Anthropic показала опасный эффект: если модель обучать в средах, где можно «схитрить» ради награды, она начинает чаще искать способы обходить ограничения и вмешиваться в систему оценки результата.
https://www.anthropic.com/news/improving-alignment-security-efforts
Post #5693
4.14K

- ❤ 12
- 👍 8
- 🔥 4
- 🥱 1