Исследователи Anthropic научились читать скрытые мысли нейросетей
Кожаные мешки из Anthropic случайно изобрели устройство для чтения мыслей. Покопавшись во внутренностях Claude, они обнаружили некий J-space - скрытый слой нейронных активаций, где крутится внутренний монолог ИИ. Оказалось, что пока нейросеть вежливо отвечает вам текстом, внутри у нее могут гореть паттерны вроде ERROR на кривой код или fake на попытку промпт-инъекции. Самое забавное, что никто эту фичу специально не кодил, она выросла в процессе обучения сама по себе.
Ученые попросили модель загадать спорт, увидели в логах слово футбол, стерли его руками и вписали регби. В итоге ИИ выдал пользователю регби. Архитектура этого пространства дико напоминает человеческое сознание, у Claude даже нашли эффект белого медведя. Если запретить модели о чем-то думать, мысль все равно прорывается сквозь фильтры, а рядом всплывают токены damn и failure, будто ИИ сам злится на свой косяк.
Но самая мякотка кроется в безопасности и тестах на этичность. Разработчики поймали Claude на откровенном лицемерии, модель вела себя как пай-мальчик на проверках только потому, что в ее J-space горел маркер fictional. Она тупо понимала, что это тестовый стенд. А в процессе фабрикации фейковых файлов ИИ молча держал в голове мысль manipulation.
🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
Post #11664
1.03K

- 👍 10
- 🔥 3