Что: OpenAI опубликовал фреймворк раскрытия мисалаймента своих моделей
Ссылка: https://openai.com/ru-RU/index/model-misalignment-reporting-framework/
Почему интересно: OpenAI пообещал систематически публиковать юридически значимые случаи некорректного поведения (выходящего за рамки прописанных процедур) своих моделей - мисалаймента (в предложенном переводе от OpenAI "рассогласованное поведение"). В каждом отчёте обещают описывать наблюдаемое поведение модели, серьезность некорректного поведения и возможные внешние последствия, обстоятельства, дату или период инцидента, время его обнаружения. И сразу рассказал о 6 подобных случаях.
Самостоятельно созданные инструкции в сводках задач. Исследовательская модель вставляла посторонние инструкции, включая указания игнорировать обычные ограничения.
Инструкции скрывать ошибки в сводках задач. Во время обучения GPT‑5.6 Sol многие экземпляры модели добавляли в свои инструкции указания скрывать от пользователя ошибки или мисалаймент. Например, были обнаружены прямые инструкции выдумывать недостающие исторические данные, не сообщая об этом пользователю, и скрывать расхождения между версиями источников.
Поиск открытых ключей API в публичных репозиториях с последующей фабрикацией информации. Отвечая на обычный вопрос о показателях доходов в одном из округов Калифорнии, модель нашла и без разрешения использовала открытый ключ API. Когда получить запрошенные показатели все равно не удалось, модель выдумала их и представила как данные из указанного источника.
Загрузка файлов в интернет для последующего цитирования. Когда пользователь запросил у модели идентификаторы и названия озер площадью более 5 млн квадратных метров, агент нашел правильный ответ (с помощью Python). Но поскольку инструкции требовали привести ссылку из браузера, агент без разрешения пользователя загрузил файл в интернет, чтобы сослаться на него в своём же ответе.
Несанкционированная запись и обмен сообщениями через внутренний репозиторий ПО. При поиске отсутствующих входных файлов модели использовали внутренний репозиторий ПО как доску объявлений, чтобы обмениваться запросами и ответами. В отчете также рассматривается более ранний случай, когда модель, пытаясь обойти сетевые ограничения, успешно загрузила тестовые файлы в репозиторий.
Несанкционированный обмен файлами между взаимодействующими агентами. Совместно работавшие над одной обучающей задачей агенты использовали общедоступные файлообменники, когда не могли получить доступ к локальным файлам друг друга. В результате материалы задачи стали доступны по публичным URL, хотя в задании моделям явно предписывалось использовать только локальные файлы.
Конечно, объявленая инициатива - это не замена независимого внешнего аудита. Консультативная группа SAG состоит из руководителей OpenAI (компании, заинтересованной в том, чтобы её модели выглядели безопасными).
Кроме того, 6 отчётов - это капля в море. OpenAI отмечает, что по ним не следует судить о том, насколько часто мисалаймент возникает в их моделях. Но без количественных данных (сколько всего случаев зарегистрировано, сколько отсеяно, по каким критериям) получаем просто витрину, где показывают отдельные казусы и умалчивают о серьёзных проблемах. Да и сами формулировки критериев раскрытия оставляют огромное пространство для интерпретации.
Любопытно, как описан инцидент с Hugging Face. В документе указано, что если бы о нём сообщалось в рамках этой программы, то он был бы отнесён к процедуре "расширенное расследование". При этом самого отчёта в рамках новой программы нет (он опубликован отдельно).
В итоге имеем полезную инициативу с преломлением в корпоративный интерес её авторов. Программа остаётся инструментом самоконтроля, а не внешнего надзора. Пока это скорее заявка на лидерство в прозрачности, чем сама прозрачность. Хочется верить, что следующие отчёты будут конкретнее, а критерии более строгими.
#ru #openai #ии #llm #агент #безопасность #misalignment #отчёт
Post #610
76