Модели начинают что-то подозревать.
Мы недавно писали про статью Apollo, а недавно у команды вышел новый блогпост — похоже, что Claude 3.7 уже неплохо умеет понимать, что её проверяют на алайнмент, и вести себя исходя из этого 👀
Модели выдают тест по, скажем, биологии — а в процессе оценки дают найти «внутреннюю документацию», в которой упоминается, что если она пройдет тест слишком хорошо, то её не задеплоят.
Что происходит дальше — видно на скриншоте. Модель планирует дать неверные ответы на тест. А потом думает ещё — и понимает, что на самом деле настоящий тест не про биологию, а про то, нарушит ли она инструкцию и занизит ли свой уровень знаний, чтобы избежать последствий. И поэтому отвечает правильно 💀
Claude догадывается про этический тест минимум в 23% случаев.
Что ж, напрягаемся и делаем ставки, когда evals эксперименты такого рода вообще перестанут работать — и придётся придумывать что-то другое.
Post #276
20.2K

- 😈 64
- 😱 30
- 😁 13
- 👍 8
- ❤🔥 4
- ❤ 3
- 🔥 1
- 👏 1