TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #293 2.87K
مقاله جدیدی که از دانشگاه مسکو اومده بیرون، یه درد مشترک ما و روس‌ها رو هدف گرفته: مدل‌های خفن مثل LLaMa-3 و Mistral روی انگلیسی عالی‌ان، ولی وقتی می‌خوایم برای زبان خودمون (Russian اونجا، Farsi اینجا) بهینه‌شون کنیم، یا باید کلی هزینه Pre-training بدیم یا با دیتاست‌های کم‌کیفیت Instruction Tuning کنیم که نتیجه‌اش میشه یه مدل که "فارسی حرف می‌زنه ولی مغزش کوچیک شده" (Catastrophic Forgetting).

راهکار این مقاله Learned Embedding Propagation (LEP) هست.

ایده اصلی اینه: به جای اینکه مدل رو از اول روی دیتاست‌های Instruction-Tuning زبان مقصد (که معمولا کمه یا بی‌کیفیته) آموزش بدیم، بیایم "دانشِ پیروی از دستورات" (Instruction Following) رو از مدل انگلیسی به مدل زبان‌مادری تزریق کنیم، اونم فقط با دستکاری Embeddingها.

روش کار به صورت خلاصه اینطوریه:
یک: ابتدا Vocabulary مدل رو دستکاری می‌کنن (تکنیک Vocabulary Conversion). توکن‌های انگلیسی رو نگه می‌دارن ولی توکن‌های اختصاصی زبان جدید رو با الگوریتم‌هایی مثل BPE یا Unigram اضافه می‌کنن تا Tokenization بهینه بشه.

دو: مدل Base رو روی متون خام زبان مقصد (Continued Pre-training) آموزش میدن. اینجا فقط Embeddingها آپدیت میشن تا مدل زبان رو بفهمه. هنوز Instruction بلد نیست.

سه: حالا بخش جذاب ماجراست. با یه تبدیل خطی (Linear Transformation)، فاصله بین Embeddingهای مدل Base و مدل Instruct انگلیسی رو یاد می‌گیرن و این تبدیل رو روی Embeddingهای مدل جدید اعمال می‌کنن. یعنی عملاً مغز Instruct-Tuned مدل انگلیسی رو "پورت" می‌کنن روی بدنه زبان‌فهم جدید.

نکته مهمی که تو بنچمارک‌گیری‌شون (که اسمش رو گذاشتن Darumeru) فهمیدن اینه که بنچمارک‌های موجود (مثل MERA یا Open Leaderboardها) قابل اعتماد نیستن چون Data Leakage توشون زیاده. برای همین یه تسک جدید به اسم DaruCopy اضافه کردن.
تسک کپی کردن (Copy Task) یعنی مدل بتونه یه متن طولانی رو بدون تغییر کپی کنه. شاید مسخره به نظر بیاد، ولی وقتی Vocabulary عوض میشه، مدل‌ها قاطی می‌کنن و شروع می‌کنن به هذیون گفتن (Hallucination). اگر مدلی نتونه متن ورودی رو کپی کنه، یعنی توکن‌های جدید رو درست مپ نکرده.

به نظر من این مقاله برای کامیونیتی فارسی طلاست. ما همیشه مشکل دیتاست باکیفیت Instruction فارسی داریم (مثل Saiga که اونا دارن). با LEP می‌تونیم Qwen-3-Instruct رو برداریم، توکن‌های فارسی رو بهش تزریق کنیم و بدون نیاز به هزاران سمپل فاین‌تیون، یه مدل اینستراکت فارسی تر و تمیز داشته باشیم که منطق مدل اصلی رو حفظ کرده.

نتایج نشون میده که این روش نه تنها هزینه‌ها رو به شدت کاهش میده، بلکه در اکثر تسک‌ها عملکردش با مدل‌هایی که فول‌فاین‌تیون شدن برابری می‌کنه یا حتی بهتره، چون دانش اصلی مدل Base کمتر دستکاری شده.

📃 عنوان مقاله: Facilitating large language model Russian adaptation with Learned Embedding Propagation
https://arxiv.org/abs/2412.21140v1

🛠 Join @LLMEngineers Community
arXiv.org Facilitating large language model Russian adaptation with Learned... Rapid advancements of large language model (LLM) technologies led to the introduction of powerful open-source instruction-tuned LLMs that have the same text generation quality as the...
  • ❤ 2
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →