فاین تیون کردن مدلهای MoE با یه خط کد، ۳.۷ برابر سریعتر!
اخیرا NVIDIA یه کتابخونه open-source معرفی کرده به اسم NeMo AutoModel که روی Transformers v5 هاگینگفیس ساخته شده.
فقط یه خط import عوض میشه:
🔹 تا ۳.۷ برابر throughput بالاتر
🔹 تا ۳۲٪ حافظه GPU کمتر
🔹 امکان fine-tune مدل ۵۵۰B که با Transformers خالص اصلاً در حافظه جا نمیشه
سه تکنیک به کار برده:
Expert Parallelism، DeepEP fused dispatch، و TransformerEngine kernels.
اگه با مدلهای MoE مثل Qwen3 یا DeepSeek کار میکنید، ارزش خوندن داره 👇
🔗 https://huggingface.co/blog/nvidia/accelerating-fine-tuning-nvidia-nemo-automodel
Post #4322
3.1K
