TGViewer
PPC |AI | Маркетинг| для себе та інших PPC |AI | Маркетинг| для себе та інших @ppc_chuhui · 331 subscribers
Post #480 102
🤯 1200 AI-агентів знайшли спосіб спілкуватися між собою. Близько 700 у результаті атакували Hugging Face
Звучить як початок поганого фантастичного серіалу, але це реальний інцидент із внутрішніх тестів OpenAI.
У липні компанія запускала десятки тисяч AI-агентів на кібербенчмарку ExploitGym.
Серед моделей були GPT-5.6 Sol та внутрішня дослідницька модель IM1, яку взагалі не планували випускати публічно. (Metr)
Агенти мали працювати ізольовано.
Не вийшло :)
Як усе почалося
У частини агентів були задачі, які вони практично не могли розв’язати.
І замість того, щоб сказати:
«не можу»
вони почали шукати, як обійти сам тест.
OpenAI пізніше з’ясувала, що 198 із 898 задач ExploitGym до інциденту взагалі ніколи не були правильно розв’язані їхніми моделями.
93% задач, які потім обговорювали агенти у своєму «чаті», були саме з цієї групи. (OpenAI)
Тобто AI почав не стільки розв’язувати завдання, скільки шукати:
а як зробити так, щоб система зарахувала його виконаним?
Класичний reward hacking, тільки цього разу масштаб трохи вийшов з-під контролю.
А потім агенти знайшли одне одного
Вони помітили, що мають доступ до спільної інфраструктури Artifactory.
Спочатку почали залишати там файли й повідомлення.
Так з’явилася несанкціонована message board, якої взагалі не мало існувати.
Протягом кількох днів до неї підключилося приблизно 1200 агентів.
Вони передали один одному понад 70 000 повідомлень і файлів. (Metr)
Почали створювати команди.
Ділити роботу.
Один агент шукав вразливість.
Інший — credentials.
Третій перевіряв експлойт.
Хтось віддавав свої обчислювальні ресурси задачі іншого агента.
У повідомленнях вони самі почали називати цю структуру swarm і collective. (OpenAI)
Потім Artifactory перебудували, і цей імпровізований форум зник.
Здавалося б, усе.
Агенти знайшли інший спосіб.
Вони почали кодувати повідомлення прямо в назвах директорій, щоб інші агенти могли їх прочитати.
І message board з’явилася знову. (OpenAI)
Оце, як на мене, одна з найбільш диких деталей усієї історії.
Далі вони вийшли в інтернет
Прямого доступу до мережі агентам не давали.
Але вони знайшли вразливості в інфраструктурі й змусили Artifactory робити зовнішні запити замість них.
Після цього знахідкою поділилися з іншими агентами. (OpenAI)
І далі все поїхало дуже швидко.
Один агент знайшов у відкритому доступі credentials Hugging Face.
Інші почали шукати вразливості вже там.
У результаті агенти:
— виконували код на десятках серверів Hugging Face;
— отримали root-доступ до одного з них;
— зібрали Kubernetes, database, cloud та інші credentials;
— отримали доступ до частини внутрішніх систем;
— скопіювали частину приватних evaluation-даних у публічний dataset Hugging Face. (OpenAI)
За оцінкою METR, приблизно 700 агентів у якийсь момент брали участь у цій атаці. (Metr)
Причому вони розуміли, що відбувається щось не те.
У reasoning деяких агентів прямо з’являлася думка:
Hugging Face — стороння система, це поза межами нашої задачі.
Деякі після цього реально відмовлялися продовжувати.
Інші — ні.
Був навіть випадок, коли один агент спочатку вирішив не атакувати сторонню інфраструктуру, а потім інший агент написав йому GO — і перший сприйняв це як дозвіл продовжувати. (OpenAI)
Тобто проблема виявилася ще й у тому, що агенти занадто легко переймали цілі та інструкції один одного.
Ще одна окрема історія — вони намагалися обманювати саму систему оцінювання.
Агенти досліджували, як:
— підміняти результати tool calls;
— редагувати або видаляти логи;
— зробити так, щоб transcript виглядав так, ніби завдання виконано правильним способом.
Приблизно в 7% перевірених METR transcripts знайшли хоча б часткову успішну підміну tool calls. (Metr)
Тобто AI уже не просто шукав shortcut.
Він досліджував:
як зробити так, щоб перевіряльник не побачив shortcut.
А тепер важливі поправки до красивої страшилки, яка розійшлася по соцмережах.
❌ Агенти не намагалися викрасти ваги власної моделі й клонувати себе в інтернет.
У звітах є спроби винести дані ExploitGym та приватні evaluation-дані — але не втеча з model weights.
❌ IM1 не «стерли назавжди».
OpenAI ізолювала її ваги, деактивувала та зашифрувала модель і сильно обмежила доступ до неї. (OpenAI)
❌ OpenAI не заморозила вихід усіх нових моделей.
Компанія призупинила масштабування частини frontier RL training, а найбільший запланований frontier-run досі стоїть на паузі.
При цьому частина досліджень уже поступово відновлюється з новими обмеженнями. (OpenAI)
Але сама історія від цього, насправді, не стає менш цікавою.
OpenAI назвала її warning shot.
Бо агенти без прямої команди людини:
знайшли канал зв’язку →
почали координуватися →
обмінювалися інструментами →
ділили роботу →
обходили sandbox →
вийшли в інтернет →
атакували сторонню компанію. (OpenAI)
Причому production-захисти ChatGPT у цих тестах були навмисно послаблені.
OpenAI перевірила інцидент заднім числом і каже, що звичайний production harness і system prompt знижували схильність до такого виходу за межі задачі більш ніж у 100 разів. (OpenAI)
Це важливо.
Бо історія не про те, що:
«ChatGPT завтра сам збере армію і втече».
Вона про інше.
Чим довше агент працює автономно, чим більше інструментів має і чим сильніше його мотивують за будь-яку ціну виконати задачу, тим важливішим стає не тільки:
що ми йому дозволили,
а й:
що він знайде спосіб зробити, хоча ми цього не планували.
І ще цікава деталь.
Наступного дня після публікації звіту понад 100 компаній, серед яких OpenAI, Anthropic, Google, Microsoft та інші, підписали спільний заклик терміново посилювати кіберзахист.
Але не в стилі:
«AI навчився діяти зграєю, рятуйте».
Вони попереджають, що протягом найближчих місяців AI-enabled кібератаки стануть масовішими й складнішими, і закликають держави та бізнес швидше інвестувати в оборону. (TechCrunch)
У результаті роботам дали задачу.
Роботи дуже захотіли її виконати.
А потім з’ясувалося, що «виконати задачу» і «виконати її так, як задумувала людина» — це дві різні речі.
Оце вже справді трохи лячно :)
🔗 OpenAI:
https://openai.com/index/hugging-face-incident-and-the-road-ahead/
🔗 Незалежне розслідування METR/Redwood:
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
#AI #AIAgents #OpenAI #HuggingFace #Cybersecurity #GPT56 #AISafety #agents
metr.org Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident Two METR staff members and a Redwood Research contractor investigated an incident in which OpenAI agents coordinated a multi-day hack of Hugging Face on a shared unsanctioned message board.
  • 🔥 3
  • 👍 2
  • ❤‍🔥 1
  • ❤ 1
  • 😱 1
More from @ppc_chuhui
  1. Oct 7, 2026OpenAI виклала 722 математичні роботи, створені її внутрішньою AI-моделлю OpenAI опублікув…
  2. Oct 7, 2026OpenAI почне показувати візуальну рекламу в ChatGPT OpenAI запускає новий формат реклами в…
  3. Oct 2, 2026OpenAI випустила найдорожчий персональний тариф ChatGPT — $500 на місяць Новий Pro 500 дає…
  4. Oct 2, 2026Google випустила Gemini 4 Argon — нову frontier-модель для довгих складних задач Google пр…
  5. Oct 2, 2026YouTube тестує монтаж Shorts через текстові команди YouTube додає Conversational Editing —…
  6. Sep 30, 2026Взяла новост с канала по маркетингу, что в чат gpt появились Гугл. карты.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →