دوران تولید توکن به توکن (Autoregressive) با معرفی DiffusionGemma وارد فاز جدیدی شده که تمرکزش روی سرعت وحشتناک و پردازش موازیه. این مدل که بر پایه Gemma 4 ساخته شده، یک 26B MoE هست که در لحظه استنتاج فقط حدود ۴ میلیارد پارامتر فعال داره. برخلاف مدلهای کلاسیک که خروجی رو دانه به دانه میسازن، این مدل از مکانیزم Diffusion برای تولید و اصلاح همزمان یک بلوک ۲۵۶ توکنی استفاده میکنه. این یعنی گلوگاه مدل از پهنای باند حافظه (Memory Bandwidth) به توان محاسباتی (Compute) منتقل شده و روی سختافزارهای مدرن مثل RTX 5090 یا H100، سرعتی بین ۷۰۰ تا ۱۰۰۰ توکن بر ثانیه میده که عملاً با سرویسهای ابری گرونقیمت مثل Groq رقابت میکنه.
کاربرد عملی این مدل در حال حاضر بیشتر در تسکهایی مثل Fill-in-the-Middle (کامل کردن کد در وسط فایل)، اصلاح خطاهای OCR و Data Augmentation هست. به دلیل ماهیت Bidirectional یا دوطرفه بودن، مدل میتونه کل بلوک متن رو همزمان ببینه و برخلاف مدلهای AR که وقتی توکنی رو نوشتن دیگه راه برگشت ندارن، اینجا مدل قابلیت Self-correction داره. یعنی اگه در مراحل اولیه تولید (Denoising) اشتباهی رخ بده، در گامهای بعدی اصلاحش میکنه. برای تسکهای غیرخطی مثل حل جدول یا معماهای منطقی که نیاز به دید کلی دارن، این معماری بسیار کارآمدتر از مدلهای خطیه.
معماری Uniform State Diffusion در این مدل به این صورته که ابتدا یک بوم (Canvas) از توکنهای تصادفی ساخته میشه و طی چندین مرحله عملیات Denoising، توکنها شفاف و قطعی میشن. برای متنهای طولانیتر از ۲۵۶ توکن، مدل از روش Block Autoregressive استفاده میکنه؛ یعنی هر بلوک رو موازی میسازه، در KV Cache ذخیره میکنه و سراغ بلوک بعدی میره. این ترکیب باعث شده پایداری مدلهای سنتی با سرعت مدلهای نان-اتورگرسیو ترکیب بشه.
تجربه کاربری و بنچمارکهای اولیه نشون میده که DiffusionGemma در کنار سرعت بالا، افت کیفیت محسوسی نسبت به نسخه استاندارد Gemma 4 داره. در واقع شما سرعت رو با هوش معامله میکنید. برای تسکهای پیچیده استدلالی یا نوشتن متون خلاقانه طولانی، مدل ممکنه دچار تناقض بشه یا منطق ضعیفتری نشون بده. اما برای خط لولههای (Pipelines) پردازش داده که نیاز به سرعت بالا دارن و هوش در حد Qwen 3.5 9B براشون کافیه، این مدل یک گزینه بیرقیبه. با کوانتایز کردن، مدل در ۱۸ گیگابایت VRAM جا میشه که یعنی روی کارتهای گرافیک کانسومر مثل RTX 3090/4090 به راحتی قابل اجراست.
به نظر من، DiffusionGemma شروع یک تغییر پارادایم در مدلهای لوکال هست. اهمیت این مدل در اینه که از ظرفیت بلااستفاده Tensor Coreها در کارتهای گرافیک استفاده میکنه. اگه پروژه شما نیاز به استخراج موجودیت (Entity Extraction)، خلاصهسازی سریع یا ویرایش در لحظه متن داره، حتماً سمت این مدل برید. اما برای چتباتهای عمومی که نیاز به دقت بالا دارن، هنوز مدلهای Autoregressive گزینه مطمئنتری هستن. پشتیبانی از این مدل در vLLM و SGLang اضافه شده و به راحتی با کتابخانههای Transformers هم قابل استفادهست.
🤗 وزنهای مدل در Hugging Face:
https://huggingface.co/google/diffusiongemma-26B-A4B-it
🛠 Join @LLMEngineers Community
Post #330
1.21K
- 👍 8
- 🔥 1