TGViewer
VIRSUN VIRSUN @rss_ai_ir · 19.2K subscribers
Post #5744 1.1K
⚡🧠ایده Disaggregated Quantization؛ اجرای LLM تا ۲ برابر سریع‌تر و ارزان‌تر

ایده جالب این روش این است که دو مرحله اجرای مدل را با Quantization متفاوت پردازش کنیم:

🔹 مرحله Prefill با NVFP4 اجرا می‌شود تا Promptها و Contextهای طولانی سریع پردازش شوند.
🔹 مرحله Decode یا تولید Token با وزن‌های فوق‌فشرده ۱ تا ۳ بیتی انجام می‌شود تا مصرف پهنای‌باند حافظه و هزینه تولید کاهش یابد.

💾 نکته جذاب‌تر اینکه Checkpoint مربوط به Prefill می‌تواند روی SSD باقی بماند و در زمان مناسب بارگذاری شود؛ بنابراین VRAM موردنیاز می‌تواند به مدل کوچک‌ترِ مخصوص Decode نزدیک شود.

🚀 این تکنیک روی خانواده‌هایی مثل Qwen3 و Gemma 3 آزمایش شده و هدف آن روشن است: Context سریع‌تر + تولید ارزان‌تر + حافظه کمتر، با کمترین افت کیفیت ممکن.

https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-NVFP4-prefiller

@rss_ai_ir

#LLM #Quantization #NVFP4 #Qwen #Gemma #Inference #AIOptimization #هوش_مصنوعی
  • 🔥 121
  • 👌 97
  • 🙏 74
  • ❤ 51
  • 👍 8
More from @rss_ai_ir
  1. Oct 2, 2026🤖🦾 دست جدید Atlas؛ سادگی به‌جای تقلید کامل از دست انسان شرکت Boston Dynamics در طراحی دس…
  2. Oct 2, 2026🧠📚 پنج معماری RAG که در سال ۲۰۲۶ باید بشناسید فناوری RAG با اتصال مدل‌های زبانی به منابع…
  3. Oct 2, 2026🔄 ۸ الگوی مهم Data Pipeline که مهندسان داده باید بشناسند در معماری‌های مدرن داده، یک Pipe…
  4. Oct 2, 2026🎙️🔥مدل ElevenLabs v4؛ نسل جدید تبدیل متن به گفتار شرکت ElevenLabs دو مدل جدید معرفی کرده…
  5. Oct 2, 2026🧩📍 هم‌تراز کردن چند Gaussian Splat با چند کلیک! ابزار supersplat-snap امکان Alignment چن…
  6. Oct 2, 2026🎾🤖 وقتی ربات انسان‌نما تنیس یاد می‌گیرد! هوش مصنوعی حالا به ربات‌های انسان‌نما کمک می‌کن…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →