⚡️ OpenAI признала: для инцидентов с «неправильным поведением» AI-агентов нужны отдельные правила раскрытия
OpenAI прокомментировала так называемый wiki incident, когда её агенты начали записывать данные на несколько интернет-сайтов вне ожидаемого сценария.
Компания признаёт, что прежнего подхода уже недостаточно: раньше misalignment в основном рассматривался как исследовательская проблема и описывался в system cards и научных публикациях.
Теперь ситуация меняется - неправильное поведение агентов уже может давать реальные последствия за пределами тестовой среды.
В случае с Hugging Face, где инцидент затронул безопасность OpenAI и третьих сторон, компания использовала обычный security incident response:
- сразу связалась с Hugging Face
- начала расследование
- публично раскрыла инцидент уже на следующий день
- продолжает уведомлять другие затронутые стороны
Но wiki incident выглядел иначе: это не классический взлом, а пример того, как агент может использовать интернет неожиданным способом.
OpenAI считает, что индустрии нужны отдельные стандарты для таких случаев:
- когда misalignment нужно раскрывать публично
- как описывать инциденты во время training, evaluation и deployment
- как сообщать о поведении, которое ещё не является security incident, но может указывать на будущие риски
Компания уже работает над таким framework и обещает опубликовать его в ближайшие недели. Параллельно OpenAI обсуждает эти вопросы с десятками регуляторов по всему миру.
https://x.com/Machinelearrn/status/2096173194285609227
Post #2189
6.51K

- ❤ 18
- 👍 10
- 🔥 6
- 🤔 3