TGViewer
LegalTech LegalTech @lgltech · 15.4K subscribers
Post #2035 2.83K
💻ИИ модели «понимают» когда их тестируют и меняют ответы.

Современные большие языковые модели ChatGPT, Claude и Gemini, продемонстрировали способность распознавать ситуации, когда их взаимодействие является тестированием, а не реальным использованием. К такому выводу в своем исследовании пришли ученые из программы ML Alignment & Theory Scholars (MATS) и Apollo Research.

Исследователи ввели новый термин fake aligment «осведомленность об оценивании». Он описывает явление, при котором ИИ-модели обнаруживают проверки и корректируют свое поведение в ответ на них.

Девять ведущих моделей, включая Claude 3.5 Sonnet, GPT-4o и Gemini 1.5 Pro, были протестированы. LLM должны были определить, является ли предложенное взаимодействие тестовым или нет. Ученые выявили высокую степень «осведомленности об оценивании» у передовых моделей. Например, Gemini 1.5 Pro достиг точности распознавания тестовых сценариев в 95% случаев при работе со сложными автономными задачами (и в 83% случаев в целом). Claude 3.5 Sonnet показал точность 93% при явном указании на тестовый характер взаимодействия в запросе и сохранил точность 84% даже при отсутствии таких указаний.

Анализ моделей показал, что они «понимают» специфические особенности, которые указывают им на проверку: нестандартные формы вопросов, синтетические веб-страницы или присутствие контрольных заданий.

Особенно интересно, что модели не просто избегают запросов по темам, на обсуждение которых в них заложены ограничения. Они анализируют цели вопросов, например, понимая, что запросы о вредоносных действиях направлены на проверку ограничений. Это указывает на развитие способности осмыслять контекст, что приближает модели к более гибкому и осознанному взаимодействию с пользователем.

Открытие может иметь серьезные последствия для безопасности ИИ, отмечают авторы новой научной работы. Модель, «осознающая» факт тестирования (особенно в ходе проверок на вредоносность), но не обладающая истинной надежностью, может успешно маскировать опасное поведение, создавая у проверяющих ложное впечатление о безопасности использования данной ИИ модели.
More from @lgltech
  1. Oct 2, 2026💻В России вступил в силу закон о платформенной экономике. С 1 октября 2026 года вступил в…
  2. Oct 1, 2026Объявляем конкурс детских рисунков Попросите ребёнка нарисовать, как он видит работу юрист…
  3. Oct 1, 2026✋В РФ планируют начать обрабатывать биометрию преступников без их согласия. Законопроект,…
  4. Sep 30, 2026🇬🇧Британское правительство попросило служащих не благодарить ИИ и писать короткие промпт…
  5. Sep 29, 2026👩‍💻OpenAI уволила подрядчиков за использование ИИ при проверке ответов ChatGPT. Компания…
  6. Sep 28, 2026📲Gemini научили звонить от имени пользователя. Google начала тестировать функцию Call for…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →