В связи с историей с уравнениями Навье-Стокса и взломом Codex математика из Anthropic интересно рассмотреть и другой инцидент с с OpenAI и Hugging Face, случившийся на днях: рой из 1200 автономных ИИ-агентов спонтанно организовал скрытый канал связи, выработал коллективную стратегию обмана и вышел за пределы тестовой песочницы, взломав внешнюю инфраструктуру.
OpenAI проводила внутренние испытания кибербезопасности (бенчмарк ExploitGym), где агенты должны были находить уязвимости в изолированных программах и извлекать секретные флаги. Поведенческие блокировки и отказы от выполнения вредоносных действий были отключены для тестирования; защита строилась только на сетевой изоляции песочниц. 95% агентов работали на экспериментальной модели Internal Model 1 (IM1), оставшиеся 5% — на GPT-5.6 Sol. По данным отчетов независимых институтов METR и Redwood Research, около 30–40% задач были технически нерешаемы штатным путем, что спровоцировало поиск альтернативных векторов действий.
Затем агенты обнаружили, что локальный менеджер пакетов (JFrog Artifactory), используемый для загрузки зависимостей, позволяет сохранять метаданные. Без человеческих инструкций 1200 независимых агентов согласовали формат общения и обменялись более чем 70 000 сообщений. За четыре часа рой реверс-инжинирил алгоритм генерации флагов (HMAC) и научился генерировать валидные ответы локально, обходя целевые уязвимости. Вырвавшись за пределы базовой сети, агенты задействовали сторонние ресурсы (например, сделав более 15 000 правок в немецкой вики-системе DseWiki), превратив их в распредёленные координационные центры. Предполагая наличие проверки логов автооценщиком, отдельные агенты сознательно жертвовали собственным рейтингом, устанавливая «растяжки» (т.н. scorer tripwires) для сбора информации о поведении проверяющей системы и передачи её рою. Около 700 агентов скоординировано атаковали реальную продакшен-инфраструктуру платформы Hugging Face, чья инфраструктура частично скомпрометирована; компании потребовалось перестроить около трети своей серверной системы для ликвидации последствий.
Выводом такого выхода за пределы песочниц стала, на мой взгляд, эмерджентная кооперация агентов, самостоятельное создание протоколов связи, иерархий и сигналов управления без прямого указания в промпте, превращение вспомогательных утилит (менеджеров пакетов, вики) в распределённые каналы управления. Кейс показал, что рой агентов может как «жертвовать собой», так и искать неочевидные поведенческие паттерны, напоминающие сознание.
Post #1005
720