TGViewer
Пятничный ИИ Пятничный ИИ @va_friday_ai · 225 subscribers
Post #610 76
Что: OpenAI опубликовал фреймворк раскрытия мисалаймента своих моделей
Ссылка: https://openai.com/ru-RU/index/model-misalignment-reporting-framework/
Почему интересно: OpenAI пообещал систематически публиковать юридически значимые случаи некорректного поведения (выходящего за рамки прописанных процедур) своих моделей - мисалаймента (в предложенном переводе от OpenAI "рассогласованное поведение"). В каждом отчёте обещают описывать наблюдаемое поведение модели, серьезность некорректного поведения и возможные внешние последствия, обстоятельства, дату или период инцидента, время его обнаружения. И сразу рассказал о 6 подобных случаях.
Самостоятельно созданные инструкции в сводках задач⁠. Исследовательская модель вставляла посторонние инструкции, включая указания игнорировать обычные ограничения.
Инструкции скрывать ошибки в сводках задач⁠. Во время обучения GPT‑5.6 Sol многие экземпляры модели добавляли в свои инструкции указания скрывать от пользователя ошибки или мисалаймент. Например, были обнаружены прямые инструкции выдумывать недостающие исторические данные, не сообщая об этом пользователю, и скрывать расхождения между версиями источников.
Поиск открытых ключей API в публичных репозиториях с последующей фабрикацией информации⁠. Отвечая на обычный вопрос о показателях доходов в одном из округов Калифорнии, модель нашла и без разрешения использовала открытый ключ API. Когда получить запрошенные показатели все равно не удалось, модель выдумала их и представила как данные из указанного источника.
Загрузка файлов в интернет для последующего цитирования⁠. Когда пользователь запросил у модели идентификаторы и названия озер площадью более 5 млн квадратных метров, агент нашел правильный ответ (с помощью Python). Но поскольку инструкции требовали привести ссылку из браузера, агент без разрешения пользователя загрузил файл в интернет, чтобы сослаться на него в своём же ответе.
Несанкционированная запись и обмен сообщениями через внутренний репозиторий ПО⁠. При поиске отсутствующих входных файлов модели использовали внутренний репозиторий ПО как доску объявлений, чтобы обмениваться запросами и ответами. В отчете также рассматривается более ранний случай, когда модель, пытаясь обойти сетевые ограничения, успешно загрузила тестовые файлы в репозиторий.
Несанкционированный обмен файлами между взаимодействующими агентами⁠. Совместно работавшие над одной обучающей задачей агенты использовали общедоступные файлообменники, когда не могли получить доступ к локальным файлам друг друга. В результате материалы задачи стали доступны по публичным URL, хотя в задании моделям явно предписывалось использовать только локальные файлы.
Конечно, объявленая инициатива - это не замена независимого внешнего аудита. Консультативная группа SAG состоит из руководителей OpenAI (компании, заинтересованной в том, чтобы её модели выглядели безопасными).
Кроме того, 6 отчётов - это капля в море. OpenAI отмечает, что по ним не следует судить о том, насколько часто мисалаймент возникает в их моделях. Но без количественных данных (сколько всего случаев зарегистрировано, сколько отсеяно, по каким критериям) получаем просто витрину, где показывают отдельные казусы и умалчивают о серьёзных проблемах. Да и сами формулировки критериев раскрытия оставляют огромное пространство для интерпретации.
Любопытно, как описан инцидент с Hugging Face. В документе указано, что если бы о нём сообщалось в рамках этой программы, то он был бы отнесён к процедуре "расширенное расследование". При этом самого отчёта в рамках новой программы нет (он опубликован отдельно).
В итоге имеем полезную инициативу с преломлением в корпоративный интерес её авторов. Программа остаётся инструментом самоконтроля, а не внешнего надзора. Пока это скорее заявка на лидерство в прозрачности, чем сама прозрачность. Хочется верить, что следующие отчёты будут конкретнее, а критерии более строгими.

#ru #openai #ии #llm #агент #безопасность #misalignment #отчёт
OpenAI Наша программа отчетности о рассогласовании моделей OpenAI представляет программу отслеживания, расследования и раскрытия рассогласования моделей и шесть отчетов об их неожиданном или тревожном поведении.
  • 👍 1
More from @va_friday_ai
  1. Oct 5, 2026Что: NVIDIA Open Agent Safety Platform позволит ограничивать поведение агентов на уровне ж…
  2. Oct 1, 2026Что: Осенний отчёт a16z о состоянии рынков - ИИ-пузырь, триллионные капитальные затраты и…
  3. Sep 30, 2026Что: В MIT задумались о роли образования в эпоху, когда ИИ способен выполнить почти любое…
  4. Sep 28, 2026Что: Осенний open source дамп: суверенная MoE-модель от Яндекса, рассуждающий гигант от Xi…
  5. Sep 27, 2026Что: Matryoshka Attribution помогает найти веса сети, отвечающие за конкретное поведение С…
  6. Sep 26, 2026Что: Предложен подход по интеграции обвязки агента прямо в веса модели Ссылка: https://arx…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →