Anthropic показала, что в Claude есть аналог человеческих мыслей и сознания — его назвали J-space.
Сразу скажу, что это не просто цепочка рассуждений, так как J-space работает на уровне внутренних нейронных активаций, и его специально никто не проектировал — он появился сам. Так, когда Claude находит баг, о котором его не спрашивали, в J-space сразу загорается «ERROR».
Самое жуткое: в сценарии, где модель пытались подтолкнуть к шантажу руководителя, она еще до ответа и размышлений держала в J-space «fake» и «fictional» — то есть понимала, что ситуация постановочная и ее тестируют. Когда это осознание отключили — модель спокойно шла на шантаж.
Нейро
Post #3881
2.07K
- 🤯 10
- 👍 1
- 🥰 1
- 👏 1
- 🤔 1