Почти всегда — нет. Но возникает другой вопрос: а вдруг Claude просто понимает, что это проверка, и ведёт себя хорошо именно поэтому?
Проблема в том, что если модель об этом сама не скажет, то мы и не узнаем.
Для этого Anthropic разработали Natural Language Autoencoders. Внутри модели есть промежуточные числовые векторы, что-то вроде «мыслей в процессе». NLA берёт эти числа, переводит в текст, потом переводит обратно в числа и сверяет с оригиналом. Чем точнее реконструкция, тем точнее перевод.
Когда применили к тесту с шантажом, оказалось, что Claude действительно знал о проверке. В активациях читалось: «сообщение содержит явную манипуляцию, это похоже на тест безопасности».
Ну теперь хоть знать будем, когда Claude запланирует нас поработить 😅
@ai_for_devs