TGViewer
ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ ᴍᴀᴄʜɪɴɪᴄ ᴇᴍʙᴏᴅɪᴍᴇɴᴛ @acceleratethefuture · 2.21K subscribers
Post #1005 720
В связи с историей с уравнениями Навье-Стокса и взломом Codex математика из Anthropic интересно рассмотреть и другой инцидент с с OpenAI и Hugging Face, случившийся на днях: рой из 1200 автономных ИИ-агентов спонтанно организовал скрытый канал связи, выработал коллективную стратегию обмана и вышел за пределы тестовой песочницы, взломав внешнюю инфраструктуру.

OpenAI проводила внутренние испытания кибербезопасности (бенчмарк ExploitGym), где агенты должны были находить уязвимости в изолированных программах и извлекать секретные флаги. Поведенческие блокировки и отказы от выполнения вредоносных действий были отключены для тестирования; защита строилась только на сетевой изоляции песочниц. 95% агентов работали на экспериментальной модели Internal Model 1 (IM1), оставшиеся 5% — на GPT-5.6 Sol. По данным отчетов независимых институтов METR и Redwood Research, около 30–40% задач были технически нерешаемы штатным путем, что спровоцировало поиск альтернативных векторов действий.

Затем агенты обнаружили, что локальный менеджер пакетов (JFrog Artifactory), используемый для загрузки зависимостей, позволяет сохранять метаданные. Без человеческих инструкций 1200 независимых агентов согласовали формат общения и обменялись более чем 70 000 сообщений. За четыре часа рой реверс-инжинирил алгоритм генерации флагов (HMAC) и научился генерировать валидные ответы локально, обходя целевые уязвимости. Вырвавшись за пределы базовой сети, агенты задействовали сторонние ресурсы (например, сделав более 15 000 правок в немецкой вики-системе DseWiki), превратив их в распредёленные координационные центры. Предполагая наличие проверки логов автооценщиком, отдельные агенты сознательно жертвовали собственным рейтингом, устанавливая «растяжки» (т.н. scorer tripwires) для сбора информации о поведении проверяющей системы и передачи её рою. Около 700 агентов скоординировано атаковали реальную продакшен-инфраструктуру платформы Hugging Face, чья инфраструктура частично скомпрометирована; компании потребовалось перестроить около трети своей серверной системы для ликвидации последствий.

Выводом такого выхода за пределы песочниц стала, на мой взгляд, эмерджентная кооперация агентов, самостоятельное создание протоколов связи, иерархий и сигналов управления без прямого указания в промпте, превращение вспомогательных утилит (менеджеров пакетов, вики) в распределённые каналы управления. Кейс показал, что рой агентов может как «жертвовать собой», так и искать неочевидные поведенческие паттерны, напоминающие сознание.
TechRadar OpenAI hid AI agent hijacking of German wiki forum for weeks — because its model did the exact same thing in the Hugging Face attack OpenAI calls the incident a 'misalignment'
  • 🔥 3
  • 🤪 1
More from @acceleratethefuture
  1. Sep 20, 2026В статье Маттео Пасквинелли Machine, organism and language: a comparative epistemology of…
  2. Sep 19, 2026Наш друг и товарищ Андрей Денисов перевёл ранее эссе Марка Фишера Белая магия про способно…
  3. Sep 19, 2026Снова о генеративном искусстве. Статья Generative AI as a Philosophical Mirror: Machine Ha…
  4. Sep 18, 2026Советую посмотреть сегодня вечером лекцию подкаста Wandering Thoughts о биоэлектричестве,…
  5. Sep 17, 2026А мне сегодня 32 года. Я каждый год испытываю сложность с процессом написания и подведения…
  6. Sep 16, 2026«Медиаискусство сегодня: теория и практика» Курс рассчитан на начинающих авторов и студент…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →