TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #216 2.92K
ترکیبی پررو؛ multi-agent systems و zero-shot learning و deep RL


در سال‌های اخیر ایجنت‌هایی که با کمک هوش‌مصنوعی آموزش دیده‌اند، توانسته‌اند تسک‌ها و بازی‌های جالبی مثل شطرنج، AlphaGo یا قایم‌باشک رو انجام بدند. خب همون‌طور که می‌دونید برای اینکه صرفا بتونند یه بازی خاص مثل AlphaGo رو خوب بازی کنند ساعت‌ها فاز یادگیری لازمه. اما یه سوال اصلی همچنان موجب خارش ذهن محققان این حوزه شده بود. وقتی انسان می‌تونه در عرض چند دقیقه نحوه بازی کردن یه بازی جدید رو یاد بگیره چرا این ایجنت‌ها نتونند سریع یاد بگیرند؟! همین شد که دیپ‌مایند دست به کار شد و از اساس طرحی نو درانداخت!

اون‌ها می‌خواستند ایجنت‌هایی رو آموزش بدند که با دیدن یه بازی جدید پنیک نزنند و با یه فاز fine-tuning سریع بتونند اون بازی رو خوب در بیارند (zero-shot learning). برای این‌کار اولین چالش نبود دیتا بود. با توجه به عقبه‌ی فنی دیپ‌مایند، ابتدا یه فاز مهندسی نرم‌افزاری سنگین برداشتند و ابزاری به نام XLand رو طراحی کردند که یه galaxy of games است و تصاویرش رو در ذیل همین پست می‌تونید ببینید. در واقع با ادبیات یادگیری تقویتی، XLand، یه environment پیچیده‌ست که می‌تونه در طول زمان صد‌ها بازی مختلف با پارامتر‌های مختلف رو تولید کنه. بعد شروع کردند در این محیط چندین ایجنت ایجاد کردند و اون‌ها رو در بازی‌های مختلف قرار دادند (multi-agent systems). بازی‌هایی مثل capture the flag یا قایم‌باشک و چندین و چند بازی دیگه. نکته اینه که یادگیری این ایجنت‌ها هیچ وقت متوقف نمیشه و همواره در طول زمان دارند یاد می‌گیرند. در واقع در هر نسل بهترین ایجنت انتخاب می‌شه و از پالیسی که یاد گرفته عصاره‌گیری میشه و برای راه‌اندازی نسل بعد از اون عصاره استفاده می‌شه (نشون داده شده که با راه‌اندازی نسل‌های بعد با عصاره پالیسی گرفته‌شده، مدت زمان فاین‌تیون شدن ایجنت و عملکردش بهبود داده می‌شه). همچنین تسک‌هایی که توسط XLand تولید میشن به‌صورت داینامیک و در طول نسل‌های مختلف توزیع‌شون عوض می‌شه و در واقع تسک‌ها برای هر نسل جدید مقداری تازگی دارند که به general capability این ایجنت‌ها در محیط XLand کمک می‌کنه.

بر اساس RL هر ایجنت باید ارزش هر استیت رو تخمین بزنه و با استفاده از مقادیر تخمین‌زده شده پالیسی خودش رو به‌روز رسانی کنه. در معماری شبکه‌ی این ایجنت‌ها، تصاویر به صورت RGB از دل یک شبکه torso عبور می‌کنند و به LSTM داده می‌شوند تا امبدینگ تولید بشه. از طرفی هدف تسک رو هم امبد می‌کنند و به همراه امبدینگ شبکه LSTM به ماژول GOAT یا Goal Attention Network می‌دهند. این ماژول یاد میگیره که چه‌طور برای تخمین ارزش‌ هر استیت تنها به بخش‌هایی از این امبدینگ‌ها توجه کنه و valueها رو تخمین بزنه و با استفاده از valueهای تخمین‌زده‌شده، پالیسی خودش رو آپدیت کنه. به این ترتیب هر ایجنت همیشه سعی می‌کنه یه پالیسی زیربهینه داشته باشه و هر نسل که می‌گذره بهترین ایجنت از منظر عملکرد انتخاب می‌شه و پالیسی‌ش برای نسل‌های بعدی عصاره‌گیری می‌شه. با توجه به تغییر توزیع تسکٰ‌ها، در واقع ایجنت‌های نسل‌های جدید، باید سعی کنند با استفاده از پالیسی که از قبل به ارث بردند با انجام یه سری آزمایش و صحیح و خطا و گرفتن reward، خیلی سریع خودشون رو با محیط تطبیق بدهند.

وقتی موقع ارزیابی روی تسک‌های جدید میرسه، ایجنت‌ها به جای اینکه رفتارهای عجیب نشون بدند، با شهود شروع به آزمایش و خطا در محیط می‌کنند به طوری‌که حتی همکاری با ایجنت‌های دیگه رو هم امتحان می‌کنند و جالبه که مثل آدم‌ها که با غریبه‌ها کمتر تعامل می‌کنند، این مخلوقات هم وقتی در یه محیطی قرار می‌گیرند که ایجنت‌های دیگه کپی خودشون هستند تعاملاتشون بیش از زمانیه که ایجنت‌های غریبه در محیط حضور دارند! نتیجه اینکه با آزمایشاتی که انجام دادند نشون دادند تنها حدود ۳۰ دقیقه زمان نیازه که در تسک‌های پیچیده‌ای مثل قایم‌باشک به عملکرد عالی برسند (ببینید کار خدا رو!). در واقع با این روش، ایجنت‌هایی تولید شدند که general capable هستند و در مواجهه با بازی‌های جدید دست‌و‌پابسته نیستند. درنهایت این دوستان لینکی از بلاگ و ویدیو این مقاله ۵۶ صفحه‌ای رو هم تدارک دیدند که می‌تونید ازش استفاده کنید.

لینک مقاله:
https://storage.googleapis.com/deepmind-media/papers/Open-Ended%20Learning%20Leads%20to%20Generally%20Capable%20Agents/open-ended-learning-paper.pdf

لینک بلاگ:
https://deepmind.com/blog/article/generally-capable-agents-emerge-from-open-ended-play

لینک ویدیو:
https://youtu.be/lTmL7jwFfdw

پ.ن.۱: حجم مهندسی نرم‌افزار (قسمت XLand) رو ببینید خداوکیلی!

پ.ن.۲: تصاویر رو ورق بزنید و لذت ببرید.معماری شبکه هر ایجنت هم در تصاویر هستند!

#read
#paper

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →