هاگینگفیس بهتازگی مجموعه آموزشی ۶ قسمتی خود با عنوان Training Agents را کامل کرده است؛ یک پلیلیست کاربردی که مسیر ساخت، ارزیابی و آموزش ایجنتها در محیطهای واقعی را به همراه کدهای کاملاً باز پوشش میدهد.
مروری بر مباحث این ۶ جلسه:
🔹 ارزیابی ایجنتها (Agentic Evaluations):
بررسی وضعیت واقعی ارزیابیها و چرایی فاصله داشتن نتایج بنچمارکها با عملکرد عملی ایجنتها در دنیای واقعی.
🔹 یادگیری تقویتی برای ایجنتها (RL for Agents):
طراحی محیطها، استراتژی Rollout، ساخت تابع پاداش و گلوگاههای استنتاج (Inference) در گذار از RL سنتی به ایجنتها.
🔹 آموزش با نظارت (SFT on Agent Traces):
تبدیل لاگها و ردپای تعاملات ایجنتها به دادههای آموزشی و فاینتیون با کتابخانههای TRL و LoRA.
🔹 تقطیر دانش (Distillation):
انتقال توانایی و مهارتهای مدلهای بزرگ به ایجنتهای کدنویسی کوچکتر و سبکتر با روشهای مختلف Distillation.
🔹 یادگیری تقویتی با GRPO:
پیادهسازی الگوریتم GRPO بعد از مرحله SFT، کار با توابع پاداش قابل اعتبارسنجی (Verifiable Rewards) و تحلیل رفتار مدل و دور زدن پاداشها (Reward Hacking).
🔹 اتصال به محیطهای تعاملی (From Rewards to Environments):
گذر از توابع پاداش ساده به ساخت محیطهای تعاملی شبیه به ساختار Gym، اتصال OpenEnv به GRPOTrainer و آموزش عملی یک ایجنت کدنویسی در محیطهای Sandbox.
لینک تماشای کل پلیلیست در یوتیوب:
https://www.youtube.com/playlist?list=PLo2EIpI_JMQvQZm-kVlz4wY1vWF0LBcf5
Post #492
501