Anthropic придумали, как в реальном времени следить за тем, какие ценности продвигает Claude в диалогах
Вместо обычной проверки перед запуском, система теперь может отслеживать, что модель говорит пользователям уже после деплоя. Если Клод вдруг начнёт вести себя аморально или доминирующе — это фиксируется.
Так можно вовремя поймать баги, джейлбрейки или просто странное поведение. Причём Клод не всегда навязывает свои принципы — иногда он просто мягко подталкивает собеседника к другому взгляду.
❤️ Data Signal
Post #92
849



- 👍 5
- 🔥 2
- ❤ 1