ترکیبی پررو؛ multi-agent systems و zero-shot learning و deep RL
در سالهای اخیر ایجنتهایی که با کمک هوشمصنوعی آموزش دیدهاند، توانستهاند تسکها و بازیهای جالبی مثل شطرنج، AlphaGo یا قایمباشک رو انجام بدند. خب همونطور که میدونید برای اینکه صرفا بتونند یه بازی خاص مثل AlphaGo رو خوب بازی کنند ساعتها فاز یادگیری لازمه. اما یه سوال اصلی همچنان موجب خارش ذهن محققان این حوزه شده بود. وقتی انسان میتونه در عرض چند دقیقه نحوه بازی کردن یه بازی جدید رو یاد بگیره چرا این ایجنتها نتونند سریع یاد بگیرند؟! همین شد که دیپمایند دست به کار شد و از اساس طرحی نو درانداخت!
اونها میخواستند ایجنتهایی رو آموزش بدند که با دیدن یه بازی جدید پنیک نزنند و با یه فاز fine-tuning سریع بتونند اون بازی رو خوب در بیارند (zero-shot learning). برای اینکار اولین چالش نبود دیتا بود. با توجه به عقبهی فنی دیپمایند، ابتدا یه فاز مهندسی نرمافزاری سنگین برداشتند و ابزاری به نام XLand رو طراحی کردند که یه galaxy of games است و تصاویرش رو در ذیل همین پست میتونید ببینید. در واقع با ادبیات یادگیری تقویتی، XLand، یه environment پیچیدهست که میتونه در طول زمان صدها بازی مختلف با پارامترهای مختلف رو تولید کنه. بعد شروع کردند در این محیط چندین ایجنت ایجاد کردند و اونها رو در بازیهای مختلف قرار دادند (multi-agent systems). بازیهایی مثل capture the flag یا قایمباشک و چندین و چند بازی دیگه. نکته اینه که یادگیری این ایجنتها هیچ وقت متوقف نمیشه و همواره در طول زمان دارند یاد میگیرند. در واقع در هر نسل بهترین ایجنت انتخاب میشه و از پالیسی که یاد گرفته عصارهگیری میشه و برای راهاندازی نسل بعد از اون عصاره استفاده میشه (نشون داده شده که با راهاندازی نسلهای بعد با عصاره پالیسی گرفتهشده، مدت زمان فاینتیون شدن ایجنت و عملکردش بهبود داده میشه). همچنین تسکهایی که توسط XLand تولید میشن بهصورت داینامیک و در طول نسلهای مختلف توزیعشون عوض میشه و در واقع تسکها برای هر نسل جدید مقداری تازگی دارند که به general capability این ایجنتها در محیط XLand کمک میکنه.
بر اساس RL هر ایجنت باید ارزش هر استیت رو تخمین بزنه و با استفاده از مقادیر تخمینزده شده پالیسی خودش رو بهروز رسانی کنه. در معماری شبکهی این ایجنتها، تصاویر به صورت RGB از دل یک شبکه torso عبور میکنند و به LSTM داده میشوند تا امبدینگ تولید بشه. از طرفی هدف تسک رو هم امبد میکنند و به همراه امبدینگ شبکه LSTM به ماژول GOAT یا Goal Attention Network میدهند. این ماژول یاد میگیره که چهطور برای تخمین ارزش هر استیت تنها به بخشهایی از این امبدینگها توجه کنه و valueها رو تخمین بزنه و با استفاده از valueهای تخمینزدهشده، پالیسی خودش رو آپدیت کنه. به این ترتیب هر ایجنت همیشه سعی میکنه یه پالیسی زیربهینه داشته باشه و هر نسل که میگذره بهترین ایجنت از منظر عملکرد انتخاب میشه و پالیسیش برای نسلهای بعدی عصارهگیری میشه. با توجه به تغییر توزیع تسکٰها، در واقع ایجنتهای نسلهای جدید، باید سعی کنند با استفاده از پالیسی که از قبل به ارث بردند با انجام یه سری آزمایش و صحیح و خطا و گرفتن reward، خیلی سریع خودشون رو با محیط تطبیق بدهند.
وقتی موقع ارزیابی روی تسکهای جدید میرسه، ایجنتها به جای اینکه رفتارهای عجیب نشون بدند، با شهود شروع به آزمایش و خطا در محیط میکنند به طوریکه حتی همکاری با ایجنتهای دیگه رو هم امتحان میکنند و جالبه که مثل آدمها که با غریبهها کمتر تعامل میکنند، این مخلوقات هم وقتی در یه محیطی قرار میگیرند که ایجنتهای دیگه کپی خودشون هستند تعاملاتشون بیش از زمانیه که ایجنتهای غریبه در محیط حضور دارند! نتیجه اینکه با آزمایشاتی که انجام دادند نشون دادند تنها حدود ۳۰ دقیقه زمان نیازه که در تسکهای پیچیدهای مثل قایمباشک به عملکرد عالی برسند (ببینید کار خدا رو!). در واقع با این روش، ایجنتهایی تولید شدند که general capable هستند و در مواجهه با بازیهای جدید دستوپابسته نیستند. درنهایت این دوستان لینکی از بلاگ و ویدیو این مقاله ۵۶ صفحهای رو هم تدارک دیدند که میتونید ازش استفاده کنید.
لینک مقاله:
https://storage.googleapis.com/deepmind-media/papers/Open-Ended%20Learning%20Leads%20to%20Generally%20Capable%20Agents/open-ended-learning-paper.pdf
لینک بلاگ:
https://deepmind.com/blog/article/generally-capable-agents-emerge-from-open-ended-play
لینک ویدیو:
https://youtu.be/lTmL7jwFfdw
پ.ن.۱: حجم مهندسی نرمافزار (قسمت XLand) رو ببینید خداوکیلی!
پ.ن.۲: تصاویر رو ورق بزنید و لذت ببرید.معماری شبکه هر ایجنت هم در تصاویر هستند!
#read
#paper
@nlp_stuff
Post #216
2.92K