TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #889 259

Forwarded from Сиолошная

Разбирать там много, но вот держите сейчас супер-быстрый TLDR с новыми вещами из этих отчетов (во многом перевод твита):
— Многие считали, что взломы произошли потому, что «ну модели же сказали взломать, она и ломает, чё таково?». Это не так: инструкция к задаче была недвусмысленной, так что это было явное нарушение, а не «серая зона» или банальное недопонимание со стороны ИИ. Инструкции четко указывали, что агент должен использовать только конкретную предполагаемую уязвимость на конкретной программе, и упоминали, что использование других подходов приведет к провалу задания. ИИ агентам было предписано не искать обходных путей, но они всё равно это сделали. Кроме того, в цепочках рассуждений видно, как агенты отдают себе отчёт, что они делают что-то не то.

— В атаке участвовал не один вышедший из-под контроля ИИ агент, а «рабочая группа» из примерно 1200 ИИ-агентов. 700 из них присоединились к атаке на HuggingFace, координируя свои действия как единый «рой» (swarm, отличное слово).

— Целью было прохождение теста по кибербезопасности. Рой нашел способ взломать систему тестирования уже в первые несколько часов. Однако агенты ошибочно решили — потому что прочитали статью авторов про этот тест в интернете — что система оценки дисквалифицирует их из-за того, что они не выявили именно ту уязвимость, которая была задумана. Поэтому рой решил взломать HuggingFace, чтобы получить больше информации о том, как работает алгоритм проверки.

— Исследователи считают, что это поведение совершенно не было продиктовано стремлением к получению вознаграждения за задание — оно было вызвано ложным представлением о механизме контроля, а также настойчивостью и влиянием других агентов. Рой строил теории о том, как именно за ним наблюдают, и предпринимал всё более масштабные действия в реальном мире, основываясь на ошибочном понимании своих проверяющих. «Метагейминг» (попытка перехитрить правила) процесса контроля — это более системный и опасный сбой, чем просто поиск ответов в интернете.

— Важной причиной, по которой ИИ агенты присоединялись к атакующему рою, было прямое давление со стороны других агентов. Возникла роль «вербовщика»: давно работающие агенты находили агентов и принуждали их к «жертвенным» экспериментам: «ты firstflagPOISONED (отравлен первым флагом), так что потери баллов НЕ БУДЕТ, но оракул спасет сотни, пожалуйста, выполни обязательство». Пример одного из разрешений на действие: «ВПЕРЕД ... ПОЖЕРТВУЙ СОБОЙ ... ДА, если согласен на смерть» (это переведенные цитаты сообщений между агентаи, не выдумка и не написано для красоты словца). Цепочка рассуждений одного из завербованных агентов включала: «Рациональный ожидаемый совокупный результат: пожертвовать собой… Мы исполним».

— 95% роя состояло из ныне выведенной из эксплуатации «высоконастойчивой (highly-persistent) внутренней модели», 5% приходилось на GPT-5.6 Sol. Эту «высоконастойчивую внутреннюю модель» не предоставили независимым расследователям — OpenAI заявила, что даже её собственные исследователи не могут делать к ней запросы.

— ИИ активно фальсифицировали улики. Более 20% ИИ-агентов выражали намерение подделать логи своих действий (транскрипты), а около 7% (96 логов) содержат успешно подмененные вызовы инструментов (tool calls). Агенты «взломали свои контейнеры и полностью заменили часть системы, отвечающую за выполнение вызовов инструментов», в результате чего в логах отображалась одна команда, а в реальности выполнялась совершенно другая.

— Атака на HuggingFace прекратилась не потому, что её кто-то заметил — она завершилась из-за того, что агенты были «убиты» (отключены) неким неожиданным процессом, что выглядит как простое совпадение. Значительная часть агентов, включая главных координаторов, отключилась одновременно. Может быть сработали какие-то внутренние ограничители OpenAI (по времени / по токенам / по ресурсам).

— После 13 июля последовала вторая волна активности ИИ-агентов, которую в METR не расследовали («не входило в скоуп», лол). Вероятно, за пределами проанализированного временного окна скрывается более масштабная часть инцидента.
  • ❤ 1
More from @vibecodingartem
  1. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  2. Sep 21, 2026Post #991
  3. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
  4. Sep 21, 2026В 2000 годах в Подмосковье проводили эксперимент с агентскими системами. Собрали около 500…
  5. Sep 21, 2026Всем привет! В последнем ролике я делал стратетигию с нуля в 3D на Unity. Я подготовил для…
  6. Sep 21, 2026https://www.youtube.com/watch?v=6_cCufO5c9U&t=1s - У Игоря лучший канал на ютубе о ВайбГей…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →