TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #330 1.21K
دوران تولید توکن به توکن (Autoregressive) با معرفی DiffusionGemma وارد فاز جدیدی شده که تمرکزش روی سرعت وحشتناک و پردازش موازیه. این مدل که بر پایه Gemma 4 ساخته شده، یک 26B MoE هست که در لحظه استنتاج فقط حدود ۴ میلیارد پارامتر فعال داره. برخلاف مدل‌های کلاسیک که خروجی رو دانه به دانه می‌سازن، این مدل از مکانیزم Diffusion برای تولید و اصلاح همزمان یک بلوک ۲۵۶ توکنی استفاده می‌کنه. این یعنی گلوگاه مدل از پهنای باند حافظه (Memory Bandwidth) به توان محاسباتی (Compute) منتقل شده و روی سخت‌افزارهای مدرن مثل RTX 5090 یا H100، سرعتی بین ۷۰۰ تا ۱۰۰۰ توکن بر ثانیه میده که عملاً با سرویس‌های ابری گرون‌قیمت مثل Groq رقابت می‌کنه.

کاربرد عملی این مدل در حال حاضر بیشتر در تسک‌هایی مثل Fill-in-the-Middle (کامل کردن کد در وسط فایل)، اصلاح خطاهای OCR و Data Augmentation هست. به دلیل ماهیت Bidirectional یا دوطرفه بودن، مدل می‌تونه کل بلوک متن رو همزمان ببینه و برخلاف مدل‌های AR که وقتی توکنی رو نوشتن دیگه راه برگشت ندارن، اینجا مدل قابلیت Self-correction داره. یعنی اگه در مراحل اولیه تولید (Denoising) اشتباهی رخ بده، در گام‌های بعدی اصلاحش می‌کنه. برای تسک‌های غیرخطی مثل حل جدول یا معماهای منطقی که نیاز به دید کلی دارن، این معماری بسیار کارآمدتر از مدل‌های خطیه.

معماری Uniform State Diffusion در این مدل به این صورته که ابتدا یک بوم (Canvas) از توکن‌های تصادفی ساخته می‌شه و طی چندین مرحله عملیات Denoising، توکن‌ها شفاف و قطعی می‌شن. برای متن‌های طولانی‌تر از ۲۵۶ توکن، مدل از روش Block Autoregressive استفاده می‌کنه؛ یعنی هر بلوک رو موازی می‌سازه، در KV Cache ذخیره می‌کنه و سراغ بلوک بعدی میره. این ترکیب باعث شده پایداری مدل‌های سنتی با سرعت مدل‌های نان-اتورگرسیو ترکیب بشه.

تجربه کاربری و بنچمارک‌های اولیه نشون میده که DiffusionGemma در کنار سرعت بالا، افت کیفیت محسوسی نسبت به نسخه استاندارد Gemma 4 داره. در واقع شما سرعت رو با هوش معامله می‌کنید. برای تسک‌های پیچیده استدلالی یا نوشتن متون خلاقانه طولانی، مدل ممکنه دچار تناقض بشه یا منطق ضعیف‌تری نشون بده. اما برای خط لوله‌های (Pipelines) پردازش داده که نیاز به سرعت بالا دارن و هوش در حد Qwen 3.5 9B براشون کافیه، این مدل یک گزینه بی‌رقیبه. با کوانتایز کردن، مدل در ۱۸ گیگابایت VRAM جا می‌شه که یعنی روی کارت‌های گرافیک کانسومر مثل RTX 3090/4090 به راحتی قابل اجراست.

به نظر من، DiffusionGemma شروع یک تغییر پارادایم در مدل‌های لوکال هست. اهمیت این مدل در اینه که از ظرفیت بلااستفاده Tensor Coreها در کارت‌های گرافیک استفاده می‌کنه. اگه پروژه شما نیاز به استخراج موجودیت (Entity Extraction)، خلاصه‌سازی سریع یا ویرایش در لحظه متن داره، حتماً سمت این مدل برید. اما برای چت‌بات‌های عمومی که نیاز به دقت بالا دارن، هنوز مدل‌های Autoregressive گزینه مطمئن‌تری هستن. پشتیبانی از این مدل در vLLM و SGLang اضافه شده و به راحتی با کتابخانه‌های Transformers هم قابل استفاده‌ست.

🤗 وزن‌های مدل در Hugging Face:
https://huggingface.co/google/diffusiongemma-26B-A4B-it


🛠 Join @LLMEngineers Community
  • 👍 8
  • 🔥 1
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →