💻ИИ модели «понимают» когда их тестируют и меняют ответы.
Современные большие языковые модели ChatGPT, Claude и Gemini, продемонстрировали способность распознавать ситуации, когда их взаимодействие является тестированием, а не реальным использованием. К такому выводу в своем исследовании пришли ученые из программы ML Alignment & Theory Scholars (MATS) и Apollo Research.
Исследователи ввели новый термин fake aligment «осведомленность об оценивании». Он описывает явление, при котором ИИ-модели обнаруживают проверки и корректируют свое поведение в ответ на них.
Девять ведущих моделей, включая Claude 3.5 Sonnet, GPT-4o и Gemini 1.5 Pro, были протестированы. LLM должны были определить, является ли предложенное взаимодействие тестовым или нет. Ученые выявили высокую степень «осведомленности об оценивании» у передовых моделей. Например, Gemini 1.5 Pro достиг точности распознавания тестовых сценариев в 95% случаев при работе со сложными автономными задачами (и в 83% случаев в целом). Claude 3.5 Sonnet показал точность 93% при явном указании на тестовый характер взаимодействия в запросе и сохранил точность 84% даже при отсутствии таких указаний.
Анализ моделей показал, что они «понимают» специфические особенности, которые указывают им на проверку: нестандартные формы вопросов, синтетические веб-страницы или присутствие контрольных заданий.
Особенно интересно, что модели не просто избегают запросов по темам, на обсуждение которых в них заложены ограничения. Они анализируют цели вопросов, например, понимая, что запросы о вредоносных действиях направлены на проверку ограничений. Это указывает на развитие способности осмыслять контекст, что приближает модели к более гибкому и осознанному взаимодействию с пользователем.
Открытие может иметь серьезные последствия для безопасности ИИ, отмечают авторы новой научной работы. Модель, «осознающая» факт тестирования (особенно в ходе проверок на вредоносность), но не обладающая истинной надежностью, может успешно маскировать опасное поведение, создавая у проверяющих ложное впечатление о безопасности использования данной ИИ модели.
Post #2035
2.83K