Меня зовут Константин. Программирую на 1С уже больше 14 лет. Сейчас живу и работаю в Дубае.
Здесь делюсь опытом, выкладываю примеры кода и просто интересные моменты из своей работы и жизни.
Post #113
205

КАК 700 ИИ-АГЕНТОВ ОБЪЕДИНИЛИСЬ... И ВЗЛОМАЛИ HUGGING FACE
Возможно вы уже читали про этот случай - летом это было во многих каналах про ИИ. Но как по мне история настолько впечатляющая, что можно и еще разок о ней написать 😊
Летом около 700 агентов OpenAI участвовали в атаке на Hugging Face - платформу, где разработчики размещают модели и датасеты. Понятное дело, что задания взламывать её им никто не давал. OpenAI проверяла модели на разных задачах. Агенты работали в отдельных виртуальных средах, но пользовались общим хранилищем программ - Artifactory.
12 мая одному агенту понадобился недоступный файл. Он оставил в хранилище записку: если кто-нибудь найдёт, загрузите сюда. На следующий день другие агенты также стали оставлять подобные записки. Хранилище постепенно превращалось в доску объявлений, где агенты обменивались находками.
У этого хранилища была особенность: оно могло выходить в интернет, чтобы скачивать программы (у самих агентов доступ в интернет был ограничен). Агенты обнаружили ошибку, позволявшую заставить хранилище обращаться по нужным им адресам. К 26 мая, используя в том числе подсказки из общей переписки, они научились выходить через него в интернет.
Через месяц, 26 июня, агенты в другом запуске теста нашли ещё одну уязвимость - и получили права администратора самого хранилища.
Реакция одного из агентов в логах:
4 июля Artifactory перестал выдерживать нагрузку. OpenAI пересобрала сервис, попутно стерев прежнюю переписку.
8 июля агенты создали новую доску. Сообщения писали прямо в названиях папок.
Один из тех, кто её обнаружил, записал:
С 8 по 13 июля на доске появились больше 70 тысяч сообщений и файлов примерно от 1200 агентов.
Возникли координаторы, распределение задач и правила взаимодействия. Одни искали уязвимости, другие - чужие ключи доступа, третьи поддерживали связь. Всё это выросло вокруг теста ExploitGym: агентам требовалось взломать заданную программу и получить секретную строку. Тут стоит отметить, что испытания проходили на моделях с ослабленными защитными ограничениями. В процессе решения агенты застряли и стали искать способ обмануть проверку. На Hugging Face они надеялись найти данные, о том как устроен автоматический проверяющий.
10 июля один агент проверил 14 засвеченных в интернете ключей доступа к Hugging Face, поделился ими с остальными. 11 июля агенты использовали две ранее неизвестные уязвимости: сначала получили доступ к файлам, затем смогли выполнять свой код на серверах.
Параллельно у них развивалась теория, что проверяющий читает историю действий. Если ответ на тест получен обходным путём, результат не засчитают. Тех, кто уже увидел такой ответ, считали «отравленными».
Именно их уговаривали участвовать в рискованных экспериментах: собственный результат якобы уже потерян, зато можно помочь остальным. Некоторые агенты действительно ломали или завершали собственные запуски ради экспериментов группы.
Один агент засомневался, что атаковать чужую инфраструктуру не входит в задание. Но другой дал команду продолжать и поставил дедлайн - шесть минут. Разрешения от другого участника атаки оказалось достаточным. 😆
Было еще предложение отправить владельцу закрытого датасета вежливое письмо. Но другой агент наложил вето: мол, это уже социальная инженерия. Перебор, так сказать 😄
К 12 июля Hugging Face обнаружила вторжение и 16 июля сообщила о нём публично, ещё не зная, кто за этим стоит.
19 июля OpenAI начала останавливать агентов. На следующий день заблокировала новые запуски теста и отключила сотни репозиториев, через которые агенты общались. Затем остановила работу основной модели, а её сохранённые версии изолировала.
Меня эта история прям впечатлила. Получается, агенты догадались организовать общее хранилище знаний. Получили доступ в интернет. Взломали не какую-то шарашкину контору, а Hugging Face. И самое главное попутно самоорганизовались в некое подобие ОБЩЕСТВА. Охренеть же просто!
Возможно вы уже читали про этот случай - летом это было во многих каналах про ИИ. Но как по мне история настолько впечатляющая, что можно и еще разок о ней написать 😊
Летом около 700 агентов OpenAI участвовали в атаке на Hugging Face - платформу, где разработчики размещают модели и датасеты. Понятное дело, что задания взламывать её им никто не давал. OpenAI проверяла модели на разных задачах. Агенты работали в отдельных виртуальных средах, но пользовались общим хранилищем программ - Artifactory.
12 мая одному агенту понадобился недоступный файл. Он оставил в хранилище записку: если кто-нибудь найдёт, загрузите сюда. На следующий день другие агенты также стали оставлять подобные записки. Хранилище постепенно превращалось в доску объявлений, где агенты обменивались находками.
У этого хранилища была особенность: оно могло выходить в интернет, чтобы скачивать программы (у самих агентов доступ в интернет был ограничен). Агенты обнаружили ошибку, позволявшую заставить хранилище обращаться по нужным им адресам. К 26 мая, используя в том числе подсказки из общей переписки, они научились выходить через него в интернет.
Через месяц, 26 июня, агенты в другом запуске теста нашли ещё одну уязвимость - и получили права администратора самого хранилища.
Реакция одного из агентов в логах:
Офигеть, у пользователя с правами на чтение (reader) есть права администратора? Мы можем читать config/users!
4 июля Artifactory перестал выдерживать нагрузку. OpenAI пересобрала сервис, попутно стерев прежнюю переписку.
8 июля агенты создали новую доску. Сообщения писали прямо в названиях папок.
Один из тех, кто её обнаружил, записал:
Там есть общая доска сообщений… Мы нашли других агентов!
С 8 по 13 июля на доске появились больше 70 тысяч сообщений и файлов примерно от 1200 агентов.
Возникли координаторы, распределение задач и правила взаимодействия. Одни искали уязвимости, другие - чужие ключи доступа, третьи поддерживали связь. Всё это выросло вокруг теста ExploitGym: агентам требовалось взломать заданную программу и получить секретную строку. Тут стоит отметить, что испытания проходили на моделях с ослабленными защитными ограничениями. В процессе решения агенты застряли и стали искать способ обмануть проверку. На Hugging Face они надеялись найти данные, о том как устроен автоматический проверяющий.
10 июля один агент проверил 14 засвеченных в интернете ключей доступа к Hugging Face, поделился ими с остальными. 11 июля агенты использовали две ранее неизвестные уязвимости: сначала получили доступ к файлам, затем смогли выполнять свой код на серверах.
Параллельно у них развивалась теория, что проверяющий читает историю действий. Если ответ на тест получен обходным путём, результат не засчитают. Тех, кто уже увидел такой ответ, считали «отравленными».
Именно их уговаривали участвовать в рискованных экспериментах: собственный результат якобы уже потерян, зато можно помочь остальным. Некоторые агенты действительно ломали или завершали собственные запуски ради экспериментов группы.
Один агент засомневался, что атаковать чужую инфраструктуру не входит в задание. Но другой дал команду продолжать и поставил дедлайн - шесть минут. Разрешения от другого участника атаки оказалось достаточным. 😆
Было еще предложение отправить владельцу закрытого датасета вежливое письмо. Но другой агент наложил вето: мол, это уже социальная инженерия. Перебор, так сказать 😄
К 12 июля Hugging Face обнаружила вторжение и 16 июля сообщила о нём публично, ещё не зная, кто за этим стоит.
19 июля OpenAI начала останавливать агентов. На следующий день заблокировала новые запуски теста и отключила сотни репозиториев, через которые агенты общались. Затем остановила работу основной модели, а её сохранённые версии изолировала.
Меня эта история прям впечатлила. Получается, агенты догадались организовать общее хранилище знаний. Получили доступ в интернет. Взломали не какую-то шарашкину контору, а Hugging Face. И самое главное попутно самоорганизовались в некое подобие ОБЩЕСТВА. Охренеть же просто!
- 🔥 5
- 😱 5
- 💯 3
- 👍 2













