آموزش و ارزیابی اصولی ایجنتها در محیطهای واقعی یکی از مهمترین چالشها در توسعه کاربردی مدلهای زبانی است و صرفاً تکیه بر بنچمارکهای رایج پاسخگوی نیازهای عملی نیست.
هاگینگفیس بهتازگی یک مجموعه ویدیویی ۶ قسمتی تحت عنوان Training Agents منتشر کرده که این مباحث را با پیادهسازی گامبهگام و کدهای متنباز بررسی میکند.
مباحث اصلی این جلسات:
۱. ارزیابی ایجنتها (Agentic Evaluations) و چرایی فاصله نمرات بنچمارکها با عملکرد واقعی
۲. یادگیری تقویتی (RL) برای ایجنتها، طراحی محیط و توابع پاداش و گلوگاههای استنتاج
۳. آموزش با نظارت (SFT) روی ردپای تعاملات ایجنتها با TRL و LoRA
۴. تقطیر دانش (Distillation) برای انتقال توانایی به ایجنتهای کدنویسی کوچکتر
۵. یادگیری تقویتی با GRPO، تحلیل منحنیهای پاداش و رفتار مدل در دور زدن پاداشها (Reward Hacking)
۶. اتصال ایجنت به محیطهای تعاملی شبیه به Gym و آموزش عملی با AsyncGRPOTrainer در محیطهای Sandbox
لینک پلیلیست کامل در یوتیوب:
https://youtube.com/playlist?list=PLo2EIpI_JMQvQZm-kVlz4wY1vWF0LBcf5
@DevTwitter | <Mehdi Allahyari/>
Post #13218
5.73K

- 👍 8
- ❤ 3