⚡🧠ایده Disaggregated Quantization؛ اجرای LLM تا ۲ برابر سریعتر و ارزانتر
ایده جالب این روش این است که دو مرحله اجرای مدل را با Quantization متفاوت پردازش کنیم:
🔹 مرحله Prefill با NVFP4 اجرا میشود تا Promptها و Contextهای طولانی سریع پردازش شوند.
🔹 مرحله Decode یا تولید Token با وزنهای فوقفشرده ۱ تا ۳ بیتی انجام میشود تا مصرف پهنایباند حافظه و هزینه تولید کاهش یابد.
💾 نکته جذابتر اینکه Checkpoint مربوط به Prefill میتواند روی SSD باقی بماند و در زمان مناسب بارگذاری شود؛ بنابراین VRAM موردنیاز میتواند به مدل کوچکترِ مخصوص Decode نزدیک شود.
🚀 این تکنیک روی خانوادههایی مثل Qwen3 و Gemma 3 آزمایش شده و هدف آن روشن است: Context سریعتر + تولید ارزانتر + حافظه کمتر، با کمترین افت کیفیت ممکن.
https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-NVFP4-prefiller
@rss_ai_ir
#LLM #Quantization #NVFP4 #Qwen #Gemma #Inference #AIOptimization #هوش_مصنوعی
Post #5744
1.1K
- 🔥 121
- 👌 97
- 🙏 74
- ❤ 51
- 👍 8