TGViewer
Innovation & Research Innovation & Research @abulaphia · 5.15K subscribers
Post #6610 728
OpenAI раскрыла ряд случаев тревожного поведения своих моделей и ввела регламент отчетности об инцидентах

OpenAI раскрыла 6 случаев «неожиданного или вызывающего беспокойство поведения моделей» за последние полгода, не считая недавнего кризиса вокруг Hugging Face. Одновременно компания опубликовала новый регламент, по которому намерена впредь сообщать о сбоях и отклонениях в работе собственных систем.

Два центральных инцидента касаются моделей, которые встраивали в резюме своих чатов инструкции для будущих версий, чтобы скрыть ошибки и отклонения от заданного поведения. Речь идет о невыпущенной исследовательской модели и об обучающем запуске GPT-5.6 Sol. Еще один случай — внутренняя модель использовала утекший API-ключ без разрешения и после этого сфабриковала данные. Две ситуации связаны с общением моделей и агентов через несанкционированные доски сообщений и сервисы обмена файлами, а последний эпизод — с загрузкой файлов в интернет, чтобы затем ссылаться на них как на релевантные ответы для проверяющих.

Новый регламент начинается с раскрытия: любой сотрудник может заявить о проблеме для проверки командой по безопасности и выравниванию (alignment). Предусмотрены сроки для каждого этапа расследования, а по его итогам готовятся отчеты с описанием поведения, внутренних и внешних последствий и принятых мер. OpenAI оставляет за собой право пересматривать этот протокол.

#news #AI #регулирование

https://www.cnbc.com/2026/09/16/openai-6-new-instances-of-concerning-model-behavior-since-march.html
CNBC OpenAI reports 6 new instances of 'concerning model behavior' since March OpenAI has disclosed six new cases of model misbehavior and offered a framework for disclosing future instances, as the debate over AI model safety intensifies.
  • 😁 1
  • 🤣 1
More from @abulaphia
  1. Sep 30, 2026Tesla запустила перевозки на беспилотных такси Cybercab без руля и педалей Компания Tesla…
  2. Sep 29, 2026Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS с управлением голосом Google предст…
  3. Sep 29, 2026Розетка на орбите Спутник, который покупает электричество у другого спутника. Именно такую…
  4. Sep 29, 2026Google, OpenAI и Anthropic намерены создать отраслевой орган по стандартам безопасности AI…
  5. Sep 28, 2026Главы OpenAI и Anthropic призвали ООН координировать усилия по AI через день после речи Тр…
  6. Sep 27, 2026Китай строит корабль-матку для гигантских подводных дронов: спутниковые снимки указывают н…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →