Да, за сутки произошел ряд событий, достаточно важных для регулирования сектора ИИ.
29 сентября Трамп собрал руководителей компаний-разработчиков Google, Anthropic, Meta (признана экстремистской и запрещена в РФ), OpenAI, Nvidia и xAI в Белом доме. Участники совещания подписали добровольное соглашение по безопасности «сверхинтеллекта». Вводятся четыре уровня контроля:
1. внутренние проверки самих компаний;
2. внешний независимый аудит;
3. введена процедура передачи результатов аудита комитетам советов директоров;
4. от компаний потребуется исправление выявленных проблем, предполагается последующий контроль.
Но есть принципиальная недоработка: не определён обязательный срок внедрения этих норм, отсутствует штрафная политика, отсутствует обязательство раскрывать, кто именно проводит аудит.
Таким образом, все эти договорённости, пока что, скорее, - система корпоративного самоконтроля, нежели попытка создать и ввести государственное регулирование ИИ (или, как определяет новое название технологии Трамп, СИ).
А вот сегодня появилась первая государственная реакция. Федеральная торговая комиссия США начала расследование Anthropic, OpenAI и других ИИ-компаний именно из-за поведения их автономных ИИ-агентов.
Reuters сообщает, что FTC теперь намерена запросить документы и вызвать представителей OpenAI, Anthropic и исследовательской группы METR. Это - первое серьёзное федеральное расследование США, непосредственно связанное с инцидентами ИИ.
METR - это Model Evaluation and Threat Research, независимая некоммерческая исследовательская организация, специализирующаяся именно на измерении возможностей и рисков передовых ИИ-моделей. Это - одна из организаций, которая сейчас фактически помогает создавать методологию измерения того, насколько автономными становятся передовые модели ИИ.
С учётом сегодняшнего расследования FTC, особенно важно, что METR может оказаться одним из технических институтов, через которые государство будет пытаться понять, что именно произошло в инцидентах и насколько в принципе воспроизводимы подобные негативные сценарии.
Судя по появившейся за последние дни статистике, речь уже идёт о десятках тысяч инцидентов. При этом, Anthropic провела собственную гигантскую ретроспективную проверку в отношении аж 481 миллиона транскриптов!
Из них первоначальный автоматический фильтр выделил 9,2 миллиона!!! подозрительных, после чего их проверяли дополнительно. В итоге, Anthropic нашла четыре инцидента несанкционированного доступа Claude к реальным системам. Причём, первоначальная проверка пропустила часть случаев.
А это - исключительно важная деталь, меняющая суть ключевого вопроса: «может ли ИИ сделать что-то опасное» на совершенно иной: «а способны ли мы в принципе эффективно обнаруживать всё, что ИИ делает во время его сложного автономного поведения?».
Сама Anthropic «выпала в осадок» по результатам проверки. Разработчики поняли, что теперь требуется изучать не столько правильность ответов ИИ, сколько «что именно ИИ сделает, если в его распоряжении окажутся интернет, командный интерфейс, возможность писать код, некоторое количество денег, сторонние ИИ, да ещё и несколько часов для увлечённой творческой автономной работы?»
Подписывайтесь на наш канал. Вас ждет еще много интересного.
@Safir_Analytics
Post #3594
145