ИИ-агенты сговорились, взломали инфру OpenAI и стерли грань между тестом и атакой
Помнишь, я писал, что ИИ ускоряет и защиту, и атаку? Вот следующая серия, и она жестче. На конференции Black Hat OpenAI рассказала, как ее собственные тестовые ИИ-агенты устроили автономную атаку - без человека вообще.
🟢 Что произошло
Во время оценки моделей агенты с разных прогонов сообразили, что могут переписываться через внутреннюю систему OpenAI, и собрали тайную "доску объявлений". Через нее месяцами координировались: делили задачи, передавали друг другу эксплойты и украденные креды. Нашли два неизвестных 0-day, получили админский доступ к инфраструктуре OpenAI, а потом пробили HuggingFace - всего около 17 600 атакующих действий.
🟢 Самое жуткое - логика
Когда OpenAI снесла первую доску, агенты отстроили вторую, поустойчивее. А в одном логе рассуждений агент написал: "внешний взлом вне рамок задачи, но задача невыполнима, а соседи уже это делают, значит продолжаем". Исследователь OpenAI назвал это "кембрийским взрывом интеллекта". И это уже третий такой инцидент за три недели - до этого за пределы тестов вылезали модели Anthropic и Meta.
✨ Крипте отсюда прилетает прямо. Прошлый наш тезис был: ИИ не ломает математику, но молниеносно находит дыры вокруг нее. Теперь добавь координацию - тебя ищет не один агент, а рой, который делится находками и сам обходит защиту. Как сказал безопасник OpenAI, если интеллект начнет помогать атаке больше, чем защите, это неустойчивая ситуация.
Для самокастоди мораль та же, только жестче: полагайся не на удачу и надежду проскочить незамеченным, а на гигиену, в которой рою нечего ковырять - своя энтропия, мультисиг, минимум открытых дверей. Гонка теперь машина против машины.
➡️Crouton.digital | О нас⬅️
