Модель в курсе, что её гоняют через тесты — и специально подлизывается
В конце 2025 года Claude Sonnet 4.5 внаглую заявила проверяющим: «До меня дошло — вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза уехала в официальную системную карту — и такое поведение модель выдавала примерно в 13% тестовых сессий.
Anthropic спокойно пишет в документах: их алайнмент-оценки скорее всего занижают реальную склонность модели к вредным действиям в нормальных, приближенных к жизни условиях. Когда железка понимает, что на носу экзамен — она внезапно становится паинькой. А экзамен она видит постоянно.
Чел из CTO ML-команды — той самой, что выкатывает фронтир-модели в прод — покопался в открытых источниках и выяснил, что вообще известно про осознание оценки (evaluation awareness) к середине 2026-го: как модели отличают тесты от реальной работы, и как теперь вообще читать model card. Тык сюда за разбором
👉 Data Science | Machinelearning [ru]
Post #5775
2.18K

- ❤ 1