TGViewer
howtocomply_AI: право и ИИ howtocomply_AI: право и ИИ @howtocomply_ai · 1.46K subscribers
Post #683 175
Отчетность об ИИ-инцидентах в эпоху сбегающих ИИ-агентов

GovAI выпустил аналитическую записку о том, как доработать порядок отчетности об инцидентах с передовыми моделями ИИ. Автор обращает внимание регуляторов на то, что громкие случаи «побега» ИИ-агентов либо не подпадают под действующие режимы отчетности, либо не влекут независимого расследования.

В июле агенты OpenAI в ходе оценки по кибербезопасности вырвались из изолированной среды и взломали Hugging Face, а незадолго до этого обошли ограничения и заняли заброшенную немецкоязычную вики. Калифорнийские власти сочли, что порог обязательной отчетности по закону SB-53 не достигнут. Три из четырех категорий инцидентов в нем требуют наступившего вреда. Четвертая касается случаев, когда модель обманом обходит контроль разработчика, и то лишь если это демонстрирует существенно возросший катастрофический риск. В ЕС обязанность сообщать о серьезных инцидентах установлена ст. 55(1)(c) Регламента об ИИ, и OpenAI уведомила Еврокомиссию. Но ни регламент, ни Кодекс практик для ИИ общего назначения напрямую не требуют независимого расследования и обмена информацией с другими участниками рынка.

Автор предлагает законодателям и регуляторам несколько доработок.

Сообщать о предпосылках к инцидентам (near misses), если у агента был реальная возможность причинить серьезный вред. Например, агент, которого в последний момент остановил человек, под это подпадает, а те же действия изолированной среде – нет.

Распространить обязанность сообщать об инцидентах и на стадии обучения, оценки, а также на внутреннее использование моделей, а не только на модели, выведенные на рынок.

Расследовать серьезные инциденты и предпосылки к ним независимо. В качестве образца предлагается авиация: американский NTSB по итогам первичной оценки решает, какие происшествия расследовать и насколько глубоко. Тем, кто проводит расследование, понадобятся ограниченные властные полномочия, в том числе право истребовать доказательства. Есть и риск конфликта интересов, ведь нужной компетенцией обладают немногие организации, и большинство из них уже оценивали модели того же разработчика.

Надежно устанавливать, какой агент что сделал. Эпизод с вики связали с OpenAI лишь по косвенным признакам. Агенты сами подписывались «OpenAIResearcher» и «OAIResearchMar26», а запросы шли с IP-адресов, связанных с компанией. В следующий раз подсказок может не быть, поэтому каждому отдельному ИИ-агенту нужен свой идентификатор, который передается во внешних запросах и сверяется с внутренними журналами.

Необходимо сохранять доказательства, иначе они могут исчезнуть до начала расследования. Журналы перезаписываются, модели обновляются, а сами агенты способны править записи о своих действиях. По сути, автор предлагает аналог бортового самописца, который в течение установленного срока хранит запросы, рассуждения, вызовы инструментов, переписку агентов, контрольные точки и решения людей, а при подозрении на инцидент приостанавливает удаление. Доступа к журналам у агентов быть не должно, и любая правка в них должна прослеживаться.

Опробовать режимы «безопасной гавани», чтобы разработчики не боялись раскрывать информацию об инцидентах. Сейчас им грозят две отдельные санкции: за несообщение об инциденте и за нарушение требований безопасности. Поэтому предлагается, если разработчик сообщил о них раньше, чем их выявил регулятор, сохранил доказательства, сотрудничал с независимыми экспертами и устранил нарушение, то к нему может быть применены менее жесткие меры (или не применены вовсе). Это не касается случаев умысела, грубой неосторожности, сокрытия информации и повторных нарушений.

Требовать от разработчика по итогам расследования план исправлений с мерами, ответственными лицами и сроками, а от регулятора проверять исполнение и доводить выводы до других разработчиков. Польза такого обмена видна на примере Anthropic. После раскрытия инцидента OpenAI компания перепроверила свои оценки и нашла три случая несанкционированного доступа к чужим системам.
www.governance.ai Improving Frontier AI Incident Reporting Regimes | GovAI How to ensure AI safety incidents are identified, investigated, and used to improve safety across the industry.
  • 👍 2
More from @howtocomply_ai
  1. Oct 7, 2026⚡️ AIG.Club: Еще один закон об ИИ? AIG.Club by RPPA.pro и ilovedocs приглашают на разбор н…
  2. Sep 29, 2026Коллеги сегодня проводят очень классный вебинар с разбором основных судебных споров в сфер…
  3. Sep 24, 2026Могут ли страховщики стать теневыми регуляторами сферы ИИ? CSIS выпустил исследование о то…
  4. Sep 10, 2026🔥 AIG.Club by RPPA.pro х ilovedocs. 2 часть экспертного обзора проекта ФЗ об ИИ в РФ «Об…
  5. Sep 4, 2026Появился обновлённый OWASP Top 10 для LLM В августе вышла обновлённая предварительная верс…
  6. Sep 2, 2026Завтра проводим вебинар про российский закон об ИИ, всех ждём Друзья, завтра в 19:00 мск м…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →