مدلهای تولید تصویر و ویدیو در ابتدای سال ۲۰۲۶ از مرحله "فقط پیکسل ساختن" رد شدن و دارن روی دو جبهه متضاد اما مکمل حرکت میکنن: سرعت دیوانهوار برای مصرفکننده نهایی و کنترلپذیری عمیق برای مهندسها. خانواده FLUX.2 [klein] با معماری Rectified Flow Transformer و استفاده از تکنیک Step Distillation، استانداردی رو تعریف کرده که تولید تصویر رو به زیر ۱ ثانیه رسونده. این مدل ۹ میلیاردی با استفاده از Qwen Text Embedder و خروجی FP8، نشون میده که بهینهسازی برای GPUهای معمولی (Consumer GPUs) اولویت اول تیم Black Forest Labs بوده. تقطیر مدل به ۴ مرحله (4-step) یعنی شما عملاً دارید Real-time تصویر میسازید، هرچند که برای کارهای سنگینتر، نسخه ۵۰ مرحلهای بیس هنوز مرجع اصلی کیفیته.
معماری Single-stream DiT در مدل Z-Image مسیر دیگهای رو باز کرده. اینجا توکنهای متنی و بصری در یک جریان واحد (Single-stream) با هم ترکیب میشن که باعث درک بهتر جزئیات متن در تصویر میشه. برخلاف مدلهای تقطیر شده، نسخه بیس Z-Image بدون Distillation منتشر شده تا قابلیت CFG و استفاده از Negative Prompt به شکل کامل حفظ بشه. به نظر من، این حرکت برای مهندسهایی که دنبال Fine-tune کردن روی استایلهای خاص هستن حیاتیه، چون مدلهای تقطیر شده (Distilled) معمولاً انعطافپذیری لازم برای یادگیری مفاهیم جدید رو ندارن و "پخته شده" به نظر میرسن.
آپدیت Qwen-Image-2512 روی نقاط ضعف کلاسیک مدلهای نفوذی (Diffusion Models) یعنی رندر کردن متن (Typography) و رئالیسم انسانی تمرکز کرده. ارائه این مدل به صورت Diffusers-native یعنی زنجیره ابزارهای Python آماده پذیرش این مدل هستن و نیازی به بازنویسی اسکریپتهای پیچیده استنتاج نیست. تمرکز روی جزئیات طبیعی نشون میده که رقابت از "ساختن تصویر کلی" به سمت "دقت در بافت" (Fine Detail) حرکت کرده و مدلها دیگه توی کشیدن انگشتها یا متون ریز کمتر سوتی میدن.
در حوزه ویدیو و مدلهای جهان (World Models)، پروژه HY-WorldPlay از شرکت Tencent با انتشار کدهای آموزش و نسخههای بهینه شده، مسیر تعاملی کردن ویدیو رو هموار کرده. ارائه نسخه ۵ میلیاردی در کنار مدل ۸ میلیاردی نشوندهنده تلاش برای مدیریت VRAM در سیستمهای محلیه. بهینهسازیهای مهندسی مثل کوانتیزاسیون مستقیم در کد استنتاج، HY-WorldPlay رو از یه پروژه تحقیقاتی به یه ابزار کاربردی برای ساخت محیطهای شبیهسازی شده و "Interactive Streaming" تبدیل کرده.
به نظر من، سال ۲۰۲۶ سالِ پیروزی مطلق DiT (Diffusion Transformers) بر معماریهای قدیمی UNet هست. ترکیب Single-stream برای درک بهتر متن و تکنیکهای Flow Matching برای سرعت بالاتر، داره فاصله بین تصور و خروجی رو به صفر میرسونه. اگه دنبال پایداری و کنترل هستید، Z-Image Base و اگه دنبال سرعت فضایی و دموهای لحظهای هستید، FLUX.2 [klein] بهترین گزینههای روی میز هستن.
📃 مخزن FLUX.2 در گیتهاب:
https://github.com/black-forest-labs/flux2
📃 مدل Z-Image در هاگینگ فیس:
https://huggingface.co/Tongyi-MAI/Z-Image
📃 پروژه HY-WorldPlay در گیتهاب:
https://github.com/Tencent-Hunyuan/HY-WorldPlay
📃 مدل Qwen-Image-2512 در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen-Image-2512
🛠 Join @LLMEngineers Community
Post #308
1.32K
- ❤ 4