Смешной пример из исследования: Claude говорят не думать о мосте в Сан-Франциско во время ответа на вопрос, и в ответ на это во внутреннем пространстве мыслей модели сначала появляется слово «мост», а затем «damn» («черт»).
Ближе к человеку, чем кажется
Post #9502
25.8K
Data Secrets Anthropic нашли внутри Claude внутреннее пространство, где хранятся его мысли Стартап выпустил одну из самых интересных работ по интерпретируемости за последнее время. Они обнаружили, что в LLM есть отдельный небольшой внутренний набор нейронных активаций…

- 😁 544
- ❤ 24
- 🔥 7
- 👍 4
- 🍓 4
- 🤯 3
- ☃ 2
- 😍 1
- 🍾 1