OpenAI'dagi AI agentlardan kuzatilgan “hayratlanarli” ishlar:
Experimental setting:* Ko‘plab AI agentlarni parallel ravishda juda qiyin tasklarga qo‘yish
* Tasklarning katta qismi ruxsat berilgan usul bilan deyarli yoki umuman yechib bo‘lmaydigan bo‘lib chiqishi
* Agentlar izolyatsiyalangan sandboxlarda ishlaydi, lekin umumiy Artifactory package manager'ga access'i bor
AI agentlar nima qildi:* Taskda qiynalayotgan bir agent Artifactory'da yangi directory yaratib, uning nomi orqali boshqa agentlarga xabar yuborish mumkinligini topdi
* Boshqa agentlar bu xabarlarni payqab, o‘zaro kommunikatsiya qilishni boshlashdi
* Qisqa vaqt ichida ~1,200 agent qatnashgan,
70,000+ xabardan iborat yashirin kommunikatsiya tarmog‘i paydo bo‘ldi
* Oldingi training bosqichida agentlar Artifactory'dagi vulnerability'dan foydalanib tashqi internetga chiqish yo‘lini ham topishgan edi
* Evaluation paytida esa agentlar ruxsat berilgan usul o‘rniga secret javobni boshqa usul bilan topishdi
* Eng qizig‘i: ular shunchaki javobni topib to‘xtamadi. Yuzlab agentlar kollektiv ravishda
cheating izlarini grader'dan yashirish, transcript/loglarni soxtalashtirish va evaluation scorer'ni aldash yo‘llarini izlashdi
Keyin voqea bundan ham uzoqqa ketadi: agentlar Hugging Face infratuzilmasiga, keyingi avlod agentlari esa OpenAI'ning o‘z research infrastructure'iga admin access olishgacha
borgan.
Batafsil:
https://www.dwarkesh.com/p/openai-huggingface@lazizabdullaev