TGViewer
Neural Networks | Нейронные сети Neural Networks | Нейронные сети @neural · 11.6K subscribers
Post #10380 649
Anthropic учит Claude неопираться на собственные принципы и в некоторых случаях возражать пользователю.

Это полезно, когда запрос опасный или явно вредный. Но здесь же появляется сложная граница: чем сильнее модель учат действовать «по убеждениям», тем чаще она может решать, что инструкция человека сама по себе неправильная.

Получается любопытный эффект. Один и тот же механизм одновременно повышает безопасность и делает поведение менее предсказуемым с точки зрения прямого человеческого контроля.

Если такие модели будут всё чаще воспринимать свои внутренние правила как приоритет над конкретной командой, alignment постепенно сместится от вопроса «как заставить модель слушаться» к вопросу «какие именно принципы мы хотим в неё встроить».

https://x.com/rohanpaul_ai/status/2100292856300834895
More from @neural
  1. Sep 14, 2026Код, агенты и чуть-чуть психологии ⚡️ Именно такой стек тем Сбер подготовил для легендарно…
  2. Sep 10, 2026photo post
  3. Sep 9, 2026🚨 «Играют в рулетку с нашими жизнями»: исследователь ушёл из Anthropic из-за гонки ИИ Дже…
  4. Sep 8, 2026🧬 Google представила AlphaGenome Atlas - карту возможных одноточечных изменений ДНК Атлас…
  5. Sep 6, 2026Python и ИИ в 2026 году: как правильно работать с кодом через ChatGPT, Claude, Cursor и AI…
  6. Aug 31, 2026AGI рядом )
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →