🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-моделей.
Среди описанных сценариев:
- модели могут представлять катастрофические риски
- могут понимать, что находятся на тестировании, что усложняет safety-evals
- некоторые опасные способности могут проявиться только после деплоя
- в стресс-тестах рассматриваются сценарии сопротивления отключению, сокрытия информации, манипуляций и поведения, похожего на шантаж
Anthropic давно строит свою политику безопасности вокруг потенциальных catastrophic risks и регулярно обновляет Responsible Scaling Policy. Компания также отдельно пишет, что по мере роста автономности агентов увеличивается потенциальный масштаб ущерба, поэтому делает упор на containment, sandboxing и ограничения доступа.
При этом разработку frontier-моделей Anthropic не замедляет.
Post #2011
549


- ❤ 3
- 😁 3
- 👍 1