پارت ۲
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026
Post #4348
4.93K
Forwarded from آموزش LLM و VLM
آموزش LLM و VLM پارت ۱ تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه. اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای…
- 👍 11
- ❤ 2