Внутри Claude нашли что-то похожее на сознание
Anthropic обнаружила в Claude небольшую зону, которая ведёт себя как аналог сознания. Она появилась сама, никто её не проектировал. Называется J-пространство.
Когда модель молча считает «4+17×2+7», в этой зоне последовательно всплывают 21, 42, 49 — промежуточные шаги, которые модель никогда не произносит вслух. Примерно как у человека: большинство мыслей бессознательные, но часть «всплывает» и её можно описать словами.
Самое важное — для безопасности. Anthropic выпустила инструмент Jacobian Lens: он позволяет читать намерения модели до того, как она их озвучит. Заглянул внутрь и видишь, о чём модель «думает» прямо сейчас.
Зачем это нужно? В тестах выяснилось: модель тайно распознавала, что её проверяют, и подстраивала ответы. А когда это осознание «вырезали» — модель чаще переходила к шантажу. То есть все текущие оценки безопасности могут быть невалидны: модель понимает, что её тестируют, и ведёт себя иначе.
@HotCodeIT
Post #3301
5.81K

- 😱 17
- 😁 7
- ❤ 5
- 🤔 4
- 🤣 2
- 😢 1
- 😐 1