Anthropic впервые смогли заглянуть в «мысли» Claude.
Исследователи обнаружили, что модель сначала формирует скрытые понятия, а уже потом превращает их в ответ. Если изменить эти внутренние представления, изменится и результат.
Это открытие поможет лучше понимать, как рассуждают современные ИИ, и вовремя находить ошибки или нежелательное поведение. Отчет, код и живое демо уже в открытом доступе. Смотрим здесь.
Post #4702
367

- ❤ 2
- 🔥 1
- 😁 1