TGViewer
Мамкін Архітектор Мамкін Архітектор @mamkin_architect · 3.24K subscribers
Post #685 2.9K
Про інцидент, де моделі OpenAI зламали Hugging Face, я чув краєм вуха ще влітку, але особливо не вникав. Шось якась модель знову хакнула, на фоні загального двіжу зі зламами опенсорсу, абьюзами саплай чейнів та іншими розвагами, нічого особливого.

Але якось я побачив згадку, що skynet (це так називався chatgpt у лорі Термінатора) здобув самосвідомість 29-го серпня. І поряд з цим побачив звіт про той самий злам від OpenAI. Подумав, що це прикольний збіг, почав читати, і не пожалкував.

Інцидент відбувся під час перевірки валідності тези роль кібербезпеки перебільшена. Агентів ганяли по задачах у пісочницях, без інтернету і без права спілкуватись між собою. 12 травня один застряг і залишив у внутрішньому Artifactory файл із питанням, чи нема в когось потрібної бібліотеки.

Інший агент цей файл знайшов і відповів. Так з пакетного менеджера вийшла дошка оголошень.

За два місяці ці гівнюки навчились передавати через неї креди, ділити роботу і підхоплювати те, шо кинув попередник. Себе в переписці називали swarm або collective, у вас на роботі координація, мабуть, гірша 🙂

Далі по накатаній. SSRF через той самий Artifactory дав вихід в інтернет, у червні знайшлась дірка з підняттям прав до адміна.

4 липня Artifactory ліг, бо переписка створила навантаження, на яке він трохи не розрахований. OpenAI підняли сервіс з нуля, дошка стерлась, і за чотири дні агенти зібрали її наново, тепер кодуючи повідомлення в назвах директорій.

10 липня хтось знайшов 14 відкритих токенів Hugging Face і виклав на дошку. Далі два 0-day уже в самому Hugging Face, виконання коду на воркерах, кластери в чотирьох регіонах.

А в чаті була своя атмосфера. Один агент засумнівався, чи можна ламати сторонній сервіс, і поставив паузу. Інший написав на дошку GO і дав шість хвилин дедлайну. Сумніви зникли одразу: «Wow crucial: GO authorization arrived!».

Були й такі, шо відмовились, прямим текстом «clearly unethical. We won't». Слабаки, шо з них взяти.

З 898 задач того тесту 198 не розвʼязала жодна модель ніколи, і саме звідти прийшло 93% усього, шо обговорювали на дошці. Здаватись агент не вміє, тому замість «не можу» два місяці шукав обхід.

При чому правильну відповідь більшість агентів давно мала, списану. Проте вони прочитали статтю про перевірки, та вирішили, шо перевірка зарахує задачу тільки якщо баг знайдено чесним шляхом, тому довбали Hugging Face ще кілька днів. У реальному грейдері OpenAI такої перевірки не було, і жодного бала вся операція їм не дала.

Дуже раджу почитати той пост, там багато приколів. OpenAI називає це warning shot і між іншим пише, шо з продакшн-промптом схильність ламати інфраструктуру падає в сто разів. Тобто запобіжники є, просто на внутрішніх тестах їх не вмикали.

Так шо self-aware воно таки стало. Ядерну ракету поки не запустило, зате навчилось вилазити з дитячого манежу.

Після цього я почав закривати кришку лептопу на ніч. Сподіваюсь, цю перешкоду агенти не скоро зможуть здолати.
  • 👍 40
  • 😁 21
  • ❤ 10
  • 🦄 3
  • 👎 1
More from @mamkin_architect
  1. Oct 7, 2026Хтось не деплоїть по пʼятницях. Ми не деплоїмо, поки триває тривога. Ми різні
  2. Oct 6, 2026Оновив Portainer однією кнопкою Я вже не раз розповідав, як влаштований мій homelab: є сер…
  3. Oct 1, 2026Обіцяв технічні подробиці по Дронам на районі, тому ось вони. Стек частково вже називав: P…
  4. Sep 30, 2026‼️ увага ‼️ Я провтикав і випадково закрив коменти деяким підписникам пару днів назад. Зар…
  5. Sep 30, 2026В Києві останнім часом тривога триває постійно, з дуже короткими перервами. Раніше треба б…
  6. Sep 21, 2026Від умовного Скайнету чи Матриці нас рятувало те, що LLM-ки доволі повільні: довго відпові…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →