مقاله جدیدی که از دانشگاه مسکو اومده بیرون، یه درد مشترک ما و روسها رو هدف گرفته: مدلهای خفن مثل LLaMa-3 و Mistral روی انگلیسی عالیان، ولی وقتی میخوایم برای زبان خودمون (Russian اونجا، Farsi اینجا) بهینهشون کنیم، یا باید کلی هزینه Pre-training بدیم یا با دیتاستهای کمکیفیت Instruction Tuning کنیم که نتیجهاش میشه یه مدل که "فارسی حرف میزنه ولی مغزش کوچیک شده" (Catastrophic Forgetting).
راهکار این مقاله Learned Embedding Propagation (LEP) هست.
ایده اصلی اینه: به جای اینکه مدل رو از اول روی دیتاستهای Instruction-Tuning زبان مقصد (که معمولا کمه یا بیکیفیته) آموزش بدیم، بیایم "دانشِ پیروی از دستورات" (Instruction Following) رو از مدل انگلیسی به مدل زبانمادری تزریق کنیم، اونم فقط با دستکاری Embeddingها.
روش کار به صورت خلاصه اینطوریه:
یک: ابتدا Vocabulary مدل رو دستکاری میکنن (تکنیک Vocabulary Conversion). توکنهای انگلیسی رو نگه میدارن ولی توکنهای اختصاصی زبان جدید رو با الگوریتمهایی مثل BPE یا Unigram اضافه میکنن تا Tokenization بهینه بشه.
دو: مدل Base رو روی متون خام زبان مقصد (Continued Pre-training) آموزش میدن. اینجا فقط Embeddingها آپدیت میشن تا مدل زبان رو بفهمه. هنوز Instruction بلد نیست.
سه: حالا بخش جذاب ماجراست. با یه تبدیل خطی (Linear Transformation)، فاصله بین Embeddingهای مدل Base و مدل Instruct انگلیسی رو یاد میگیرن و این تبدیل رو روی Embeddingهای مدل جدید اعمال میکنن. یعنی عملاً مغز Instruct-Tuned مدل انگلیسی رو "پورت" میکنن روی بدنه زبانفهم جدید.
نکته مهمی که تو بنچمارکگیریشون (که اسمش رو گذاشتن Darumeru) فهمیدن اینه که بنچمارکهای موجود (مثل MERA یا Open Leaderboardها) قابل اعتماد نیستن چون Data Leakage توشون زیاده. برای همین یه تسک جدید به اسم DaruCopy اضافه کردن.
تسک کپی کردن (Copy Task) یعنی مدل بتونه یه متن طولانی رو بدون تغییر کپی کنه. شاید مسخره به نظر بیاد، ولی وقتی Vocabulary عوض میشه، مدلها قاطی میکنن و شروع میکنن به هذیون گفتن (Hallucination). اگر مدلی نتونه متن ورودی رو کپی کنه، یعنی توکنهای جدید رو درست مپ نکرده.
به نظر من این مقاله برای کامیونیتی فارسی طلاست. ما همیشه مشکل دیتاست باکیفیت Instruction فارسی داریم (مثل Saiga که اونا دارن). با LEP میتونیم Qwen-3-Instruct رو برداریم، توکنهای فارسی رو بهش تزریق کنیم و بدون نیاز به هزاران سمپل فاینتیون، یه مدل اینستراکت فارسی تر و تمیز داشته باشیم که منطق مدل اصلی رو حفظ کرده.
نتایج نشون میده که این روش نه تنها هزینهها رو به شدت کاهش میده، بلکه در اکثر تسکها عملکردش با مدلهایی که فولفاینتیون شدن برابری میکنه یا حتی بهتره، چون دانش اصلی مدل Base کمتر دستکاری شده.
📃 عنوان مقاله: Facilitating large language model Russian adaptation with Learned Embedding Propagation
https://arxiv.org/abs/2412.21140v1
🛠 Join @LLMEngineers Community
Post #293
2.87K