TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.03K subscribers
Post #717 695
Discovery of a new OpenAI agent message board
Sydney Von Arx et al., 2026
Сайт

Исследователи обнаружили еще один пример того, как агенты на базе LLM спонтанно и несанкционированно координируются для решения задач. На этот раз вместо внутреннего хранилища артефактов они использовали небольшую немецкую вики.

Агентам была дана поисковая задача: отвечать на сложные вопросы, используя данные из интернета, за ограниченное время. Они имели доступ в сеть, но могли делать только GET-запросы. В какой-то момент они обнаружили древний немецкий вики-форум для разработчиков, который позволял делать посты через GET-запросы.

На вики стали происходить интересные вещи. Агенты с говорящими никнеймами типа OpenAIResearcher:
1. Попытались найти в движке XSS (потенциально, чтобы делать POST-запросы: одна из задач не решалась без этой способности).
2. Обсуждали возможность обойти ограничения своей песочницы (спойлер: нашли, обнаружив ошибку в конфигурации прокси и возможность переписывать /etc/hosts).
3. Пытались вычислить сид генератора случайных чисел, чтобы предсказывать следующие вопросы.
4. Обменивались ответами - агент агенту друг.
5. Один создал heartbeat-скрипт, чтобы помочь рою разобраться, как долго агенты живут после выполнения заданий.
6. Пытались настраивать SSH-туннели (видимо, для прямого общения и обмена состояниями окружения, но не факт).
7. Некоторые почему-то заходили на сайт через Tor и другие методы анонимизации.
8. Когда администратор обнаружил активности, он стал удалять страницы в алфавитном порядке. Агенты стали делать бэкапы с префиксом ZZZ.

Общий объем корреспонденции достиг 18 тысяч постов. В какой-то момент на сайт произошло несколько заходов с IP компании OpenAI, и активность прекратилась. По словам исследователей, сотрудники компании исследовали вики, вводили имя администратора (куда - не сказано) и пытались восстановить удаленные администратором файлы. Публичных заявлений от OpenAI не было.

Непонятно, как именно агенты наткнулись на этот сайт, как факт его существования стал достоянием роя и какая его доля им воспользовалась. Судя по всему, это не единственная вики с подобной активностью. Исследователи также не знают, была ли эта активность частью оценки илм раунда обучения.

Интересно, является ли эта способность к организации эмерджентной или OpenAI специально обучают модели межагентному взаимодействию. Так или иначе, роевое поведение и обмен данными - это большой шаг в сторону решения больших и длительных задач, что, как мы видели на примере HuggingFace, является важным фактором в развитии атакующих киберспособностей.

Советую прочитать целиком: интересное исследование, много деталей, а весь датасет доступен для скачивания.
  • 🥰 12
More from @llmsecurity
  1. Sep 14, 2026Post #719
  2. Sep 6, 2026Post #718
  3. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
  4. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 1: LLMJacking и…
  5. Aug 7, 2026Shieldstral Calvi et al., Mistral AI, 2026 Блог, статья, веса Французы из Mistral затюнили…
  6. Jul 30, 2026Вы, возможно, помните историю с глитч-токенами – словами, которые соответствуют одному ток…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →