امروز داشتم پیپر SkillOpt رو میخوندم که مایکروسافت منتشر کرده. یه ایده کاربردی برای وقتهایی که به وزنهای مدل دسترسی نداریم یا تغییر دادنشون گرونه.
مسئله اینه که وقتی میخوایم یه مدل زبانی رو برای یه کار پیچیده مثل کار با ابزارها تنظیم کنیم، معمولا دستورالعملها رو دستی مینویسیم یا میدیم خود مدل یک بار بازنویسیشون کنه. این روشها پایدار نیستن و با بازخورد گرفتن بهتر نمیشن.
ایده اصلی این پیپر اینه که فایل متنی SKILL.md رو مثل یه متغیر قابل آموزش توی شبکههای عصبی در نظر بگیریم. مدل اصلی کاملا ثابت میمونه و یه مدل دیگه به عنوان بهینهساز، فقط روی همون متن کار میکنه.
سازوکارش دقیقا از مفاهیم یادگیری عمیق الگو برداشته، ولی روی فضای متن:
- اول مدل روی یه دسته از تسک ها کار میکنه تا خروجیهای درست و غلط جمع بشن.
- مدل بهینهساز، الگوهای تکراریِ شکست و موفقیت رو تحلیل میکنه.
- به جای اینکه کل متن رو از نو بنویسه، فقط بخشهای خاصی رو اضافه یا جایگزین میکنه. این سقف تعداد تغییرات مجاز، اینجا دقیقا کارکرد نرخ یادگیری رو داره تا متن یهو به هم نریزه.
- تغییرات روی یه دیتاسِت جداگانه تست میشن. فقط اگه امتیاز واقعا بهتر بشه، تغییر روی فایل نهایی اعمال میشه.
- اگه تغییری امتیاز رو کم کنه، میره تو یه حافظه موقت تا مدل دوباره همون اشتباه رو برای ویرایشهای بعدی تکرار نکنه.
نتایج تستها روی شش تا بنچمارک مختلف (از پرسشوپاسخ تا کار با فایلهای اکسل) و هفت تا مدل (از نسخههای جیپیتی ۵.۵ تا qwen) نشون میده که این روش به شدت خوب کار میکنه.
- روی جیپیتی ۵.۵، میانگین دقت رو حدود ۲۳.۵ درصد نسبت به حالت بدون دستورالعمل بالا برده.
- خروجی نهایی بعد از همه این کارها، فقط یه فایل متنی کوچیک بین ۳۰۰ تا ۲۰۰۰ توکنه.
- دستورالعملی که برای یه مدل قوی بهینه شده، به طرز عجیبی روی مدلهای کوچیکتر هم جواب میده و قابل انتقاله.
تو عمل کاربردش مشخصه. وقتی یه سیستم مبتنی بر ایجنت مینویسی، به جای مهندسی پرامپتهای طولانی و حدسی، این لوپ رو ران میکنی. آخر سر یه فایل متنی تمیز داری که میذاری تو سیستم پرامپتت. هزینه استفاده از API فقط موقع آموزش پرداخت میشه و موقع اجرای نهایی رو پروداکشن، هیچ بار پردازشی یا فراخوانی اضافهای نداری.
البته محدودیتهای خودش رو هم داره.
- برای کار کردن این لوپ، حتما باید یه سیستم نمرهدهی خودکار و دقیق داشته باشی. روی تسکهای باز و سلیقهای که نمیشه براشون اسکریپت اعتبارسنجی نوشت، درست کار نمیکنه.
- هزینه توکن موقع آموزش بالاست. برای یه تسک پیچیده ممکنه دهها میلیون توکن مصرف کنی تا به اون یه دونه فایل متنی نهایی برسی.
🛠 Join @LLMEngineers Community
Post #438
1.41K
- 👍 3
- 👌 2
- 🔥 1