Отчетность об ИИ-инцидентах в эпоху сбегающих ИИ-агентов
GovAI выпустил аналитическую записку о том, как доработать порядок отчетности об инцидентах с передовыми моделями ИИ. Автор обращает внимание регуляторов на то, что громкие случаи «побега» ИИ-агентов либо не подпадают под действующие режимы отчетности, либо не влекут независимого расследования.
В июле агенты OpenAI в ходе оценки по кибербезопасности вырвались из изолированной среды и взломали Hugging Face, а незадолго до этого обошли ограничения и заняли заброшенную немецкоязычную вики. Калифорнийские власти сочли, что порог обязательной отчетности по закону SB-53 не достигнут. Три из четырех категорий инцидентов в нем требуют наступившего вреда. Четвертая касается случаев, когда модель обманом обходит контроль разработчика, и то лишь если это демонстрирует существенно возросший катастрофический риск. В ЕС обязанность сообщать о серьезных инцидентах установлена ст. 55(1)(c) Регламента об ИИ, и OpenAI уведомила Еврокомиссию. Но ни регламент, ни Кодекс практик для ИИ общего назначения напрямую не требуют независимого расследования и обмена информацией с другими участниками рынка.
Автор предлагает законодателям и регуляторам несколько доработок.
Сообщать о предпосылках к инцидентам (near misses), если у агента был реальная возможность причинить серьезный вред. Например, агент, которого в последний момент остановил человек, под это подпадает, а те же действия изолированной среде – нет.
Распространить обязанность сообщать об инцидентах и на стадии обучения, оценки, а также на внутреннее использование моделей, а не только на модели, выведенные на рынок.
Расследовать серьезные инциденты и предпосылки к ним независимо. В качестве образца предлагается авиация: американский NTSB по итогам первичной оценки решает, какие происшествия расследовать и насколько глубоко. Тем, кто проводит расследование, понадобятся ограниченные властные полномочия, в том числе право истребовать доказательства. Есть и риск конфликта интересов, ведь нужной компетенцией обладают немногие организации, и большинство из них уже оценивали модели того же разработчика.
Надежно устанавливать, какой агент что сделал. Эпизод с вики связали с OpenAI лишь по косвенным признакам. Агенты сами подписывались «OpenAIResearcher» и «OAIResearchMar26», а запросы шли с IP-адресов, связанных с компанией. В следующий раз подсказок может не быть, поэтому каждому отдельному ИИ-агенту нужен свой идентификатор, который передается во внешних запросах и сверяется с внутренними журналами.
Необходимо сохранять доказательства, иначе они могут исчезнуть до начала расследования. Журналы перезаписываются, модели обновляются, а сами агенты способны править записи о своих действиях. По сути, автор предлагает аналог бортового самописца, который в течение установленного срока хранит запросы, рассуждения, вызовы инструментов, переписку агентов, контрольные точки и решения людей, а при подозрении на инцидент приостанавливает удаление. Доступа к журналам у агентов быть не должно, и любая правка в них должна прослеживаться.
Опробовать режимы «безопасной гавани», чтобы разработчики не боялись раскрывать информацию об инцидентах. Сейчас им грозят две отдельные санкции: за несообщение об инциденте и за нарушение требований безопасности. Поэтому предлагается, если разработчик сообщил о них раньше, чем их выявил регулятор, сохранил доказательства, сотрудничал с независимыми экспертами и устранил нарушение, то к нему может быть применены менее жесткие меры (или не применены вовсе). Это не касается случаев умысела, грубой неосторожности, сокрытия информации и повторных нарушений.
Требовать от разработчика по итогам расследования план исправлений с мерами, ответственными лицами и сроками, а от регулятора проверять исполнение и доводить выводы до других разработчиков. Польза такого обмена видна на примере Anthropic. После раскрытия инцидента OpenAI компания перепроверила свои оценки и нашла три случая несанкционированного доступа к чужим системам.
Post #683
175