Anthropic учит Claude неопираться на собственные принципы и в некоторых случаях возражать пользователю.
Это полезно, когда запрос опасный или явно вредный. Но здесь же появляется сложная граница: чем сильнее модель учат действовать «по убеждениям», тем чаще она может решать, что инструкция человека сама по себе неправильная.
Получается любопытный эффект. Один и тот же механизм одновременно повышает безопасность и делает поведение менее предсказуемым с точки зрения прямого человеческого контроля.
Если такие модели будут всё чаще воспринимать свои внутренние правила как приоритет над конкретной командой, alignment постепенно сместится от вопроса «как заставить модель слушаться» к вопросу «какие именно принципы мы хотим в неё встроить».
https://x.com/rohanpaul_ai/status/2100292856300834895
Post #10380
649

