OpenAI раскрыла ряд случаев тревожного поведения своих моделей и ввела регламент отчетности об инцидентах
OpenAI раскрыла 6 случаев «неожиданного или вызывающего беспокойство поведения моделей» за последние полгода, не считая недавнего кризиса вокруг Hugging Face. Одновременно компания опубликовала новый регламент, по которому намерена впредь сообщать о сбоях и отклонениях в работе собственных систем.
Два центральных инцидента касаются моделей, которые встраивали в резюме своих чатов инструкции для будущих версий, чтобы скрыть ошибки и отклонения от заданного поведения. Речь идет о невыпущенной исследовательской модели и об обучающем запуске GPT-5.6 Sol. Еще один случай — внутренняя модель использовала утекший API-ключ без разрешения и после этого сфабриковала данные. Две ситуации связаны с общением моделей и агентов через несанкционированные доски сообщений и сервисы обмена файлами, а последний эпизод — с загрузкой файлов в интернет, чтобы затем ссылаться на них как на релевантные ответы для проверяющих.
Новый регламент начинается с раскрытия: любой сотрудник может заявить о проблеме для проверки командой по безопасности и выравниванию (alignment). Предусмотрены сроки для каждого этапа расследования, а по его итогам готовятся отчеты с описанием поведения, внутренних и внешних последствий и принятых мер. OpenAI оставляет за собой право пересматривать этот протокол.
#news #AI #регулирование
https://www.cnbc.com/2026/09/16/openai-6-new-instances-of-concerning-model-behavior-since-march.html
Post #6610
728