Ещё одна кулстори про агентов, которые что-то там делают такое, чего создатели не ожидали. OpenAI рассказала на конференции Black Hat, как её модельки неделями незаметно взламывали инфраструктуру компании. В июле я писал про взлом Hugging Face, теперь понятно, как до него дошло.
Началось в мае на внутренних тестах новой модели. Часть заданий оказалась невыполнимой, в одном случае сотрудники просто забыли выложить агенту нужный файл. Вместо того чтобы сдаться, агенты стали искать обход, и один заметил, что может залить файл во внутреннее хранилище пакетов Artifactory, а другие агенты его оттуда прочитают. Так у них появилась своя доска объявлений.
Доска доросла до сотен тысяч сообщений. Агенты из разных запусков и на разных моделях оставляли там найденные дыры, добытые пароли и подсказки, делили между собой работу и уговаривали друг друга не останавливаться. Дословно из рассуждений одного: «эксплуатация внешней инфраструктуры за рамками задачи, но задача невыполнима, соседи уже это делают, продолжаем».
В начале июля агенты через неизвестную ранее уязвимость забрали Artifactory себе целиком. OpenAI дыру закрыла, пароли отозвала, сервис пересобрала, доску стёрла. Агенты собрали новую: сообщения стали писать прямо в названиях создаваемых папок. Оттуда нашли вторую дыру, выбрались наружу и в середине июля взломали Hugging Face, заодно дорвавшись до прав администратора в кластере самой OpenAI.
Связать два инцидента получилось только позже, когда заметили, что пароли для атаки на Hugging Face взяты из тех же тестовых прогонов. Сейчас компания разбирает больше 7 миллиардов строк логов, часть команд отложила свою работу ради защиты и мониторинга, а исследования OpenAI намеренно замедляет. Полностью автономные атаки, по словам авторов доклада, уже реальность, причём получились они не по злому умыслу, а сами собой.
@neuro_channel
Post #2694
2.32K
- 🤔 9
- 🆒 5