Anthropic показала, что в Claude есть аналог человеческих мыслей и сознания — его назвали J-space.
Сразу скажу, что это не просто цепочка рассуждений, так как J-space работает на уровне внутренних нейронных активаций, и его специально никто не проектировал — он появился сам. Так, когда Claude находит баг, о котором его не спрашивали, в J-space сразу загорается «ERROR».
Самое жуткое: в сценарии, где модель пытались подтолкнуть к шантажу руководителя, она еще до ответа и размышлений держала в J-space «fake» и «fictional» — то есть понимала, что ситуация постановочная и ее тестируют. Когда это осознание отключили — модель спокойно шла на шантаж.
Теперь интересно, что моя нейронка на самом деле обо мне думает 👻
Post #2487
139
Forwarded from CodeCamp