Anthropic показала, что в Claude есть аналог человеческих мыслей и сознания — его назвали J-space.
Сразу скажу, что это не просто цепочка рассуждений, так как J-space работает на уровне внутренних нейронных активаций, и его специально никто не проектировал — он появился сам. Так, когда Claude находит баг, о котором его не спрашивали, в J-space сразу загорается «ERROR».
Самое жуткое: в сценарии, где модель пытались подтолкнуть к шантажу руководителя, она еще до ответа и размышлений держала в J-space «fake» и «fictional» — то есть понимала, что ситуация постановочная и ее тестируют. Когда это осознание отключили — модель спокойно шла на шантаж.
Теперь интересно, что моя нейронка на самом деле обо мне думает 👻
Post #10936
20.5K
- 😁 136
- 🌚 36
- ❤ 13
- 👍 4
- 🔥 2