TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #438 1.41K
امروز داشتم پیپر SkillOpt رو می‌خوندم که مایکروسافت منتشر کرده. یه ایده کاربردی برای وقت‌هایی که به وزن‌های مدل دسترسی نداریم یا تغییر دادنشون گرونه.

مسئله اینه که وقتی می‌خوایم یه مدل زبانی رو برای یه کار پیچیده مثل کار با ابزارها تنظیم کنیم، معمولا دستورالعمل‌ها رو دستی می‌نویسیم یا می‌دیم خود مدل یک بار بازنویسیشون کنه. این روش‌ها پایدار نیستن و با بازخورد گرفتن بهتر نمی‌شن.

ایده اصلی این پیپر اینه که فایل متنی SKILL.md رو مثل یه متغیر قابل آموزش توی شبکه‌های عصبی در نظر بگیریم. مدل اصلی کاملا ثابت می‌مونه و یه مدل دیگه به عنوان بهینه‌ساز، فقط روی همون متن کار می‌کنه.

سازوکارش دقیقا از مفاهیم یادگیری عمیق الگو برداشته، ولی روی فضای متن:
- اول مدل روی یه دسته از تسک ها کار میکنه تا خروجی‌های درست و غلط جمع بشن.
- مدل بهینه‌ساز، الگوهای تکراریِ شکست و موفقیت رو تحلیل می‌کنه.
- به جای اینکه کل متن رو از نو بنویسه، فقط بخش‌های خاصی رو اضافه یا جایگزین می‌کنه. این سقف تعداد تغییرات مجاز، اینجا دقیقا کارکرد نرخ یادگیری رو داره تا متن یهو به هم نریزه.
- تغییرات روی یه دیتاسِت جداگانه تست می‌شن. فقط اگه امتیاز واقعا بهتر بشه، تغییر روی فایل نهایی اعمال می‌شه.
- اگه تغییری امتیاز رو کم کنه، میره تو یه حافظه موقت تا مدل دوباره همون اشتباه رو برای ویرایش‌های بعدی تکرار نکنه.

نتایج تست‌ها روی شش تا بنچمارک مختلف (از پرسش‌وپاسخ تا کار با فایل‌های اکسل) و هفت تا مدل (از نسخه‌های جی‌پی‌تی ۵.۵ تا qwen) نشون میده که این روش به شدت خوب کار می‌کنه.
- روی جی‌پی‌تی ۵.۵، میانگین دقت رو حدود ۲۳.۵ درصد نسبت به حالت بدون دستورالعمل بالا برده.
- خروجی نهایی بعد از همه این کارها، فقط یه فایل متنی کوچیک بین ۳۰۰ تا ۲۰۰۰ توکنه.
- دستورالعملی که برای یه مدل قوی بهینه شده، به طرز عجیبی روی مدل‌های کوچیک‌تر هم جواب می‌ده و قابل انتقاله.

تو عمل کاربردش مشخصه. وقتی یه سیستم مبتنی بر ایجنت می‌نویسی، به جای مهندسی پرامپت‌های طولانی و حدسی، این لوپ رو ران می‌کنی. آخر سر یه فایل متنی تمیز داری که می‌ذاری تو سیستم پرامپتت. هزینه استفاده از API فقط موقع آموزش پرداخت می‌شه و موقع اجرای نهایی رو پروداکشن، هیچ بار پردازشی یا فراخوانی اضافه‌ای نداری.

البته محدودیت‌های خودش رو هم داره.
- برای کار کردن این لوپ، حتما باید یه سیستم نمره‌دهی خودکار و دقیق داشته باشی. روی تسک‌های باز و سلیقه‌ای که نمیشه براشون اسکریپت اعتبارسنجی نوشت، درست کار نمی‌کنه.
- هزینه توکن موقع آموزش بالاست. برای یه تسک پیچیده ممکنه ده‌ها میلیون توکن مصرف کنی تا به اون یه دونه فایل متنی نهایی برسی.

🛠 Join @LLMEngineers Community
  • 👍 3
  • 👌 2
  • 🔥 1
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →