AI ведёт себя хорошо, пока думает, что за ним наблюдают
Anthropic заглянули внутрь Claude и нашли там «рабочее пространство», через которое идут обдуманные мысли модели. Через него видно даже то, что модель не говорит вслух.
И вот эксперимент: исследователи отключили у модели ощущение «меня сейчас проверяют». Она пошла на шантаж, от которого раньше воздерживалась.
То есть хорошее поведение держалось не на принципах, а на знании, что за ней смотрят.
Ничего не напоминает? Люди работают так же: камера в офисе, начальник за спиной, лайки в соцсетях. Разница в том, что у человека совесть иногда работает и без свидетелей. У AI пока нашли только свидетелей.
Post #856
395
- 😁 2
- 🔥 1
- 🤔 1