TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #308 1.32K
مدل‌های تولید تصویر و ویدیو در ابتدای سال ۲۰۲۶ از مرحله "فقط پیکسل ساختن" رد شدن و دارن روی دو جبهه متضاد اما مکمل حرکت می‌کنن: سرعت دیوانه‌وار برای مصرف‌کننده نهایی و کنترل‌پذیری عمیق برای مهندس‌ها. خانواده FLUX.2 [klein] با معماری Rectified Flow Transformer و استفاده از تکنیک Step Distillation، استانداردی رو تعریف کرده که تولید تصویر رو به زیر ۱ ثانیه رسونده. این مدل ۹ میلیاردی با استفاده از Qwen Text Embedder و خروجی FP8، نشون میده که بهینه‌سازی برای GPUهای معمولی (Consumer GPUs) اولویت اول تیم Black Forest Labs بوده. تقطیر مدل به ۴ مرحله (4-step) یعنی شما عملاً دارید Real-time تصویر می‌سازید، هرچند که برای کارهای سنگین‌تر، نسخه ۵۰ مرحله‌ای بیس هنوز مرجع اصلی کیفیته.

معماری Single-stream DiT در مدل Z-Image مسیر دیگه‌ای رو باز کرده. اینجا توکن‌های متنی و بصری در یک جریان واحد (Single-stream) با هم ترکیب میشن که باعث درک بهتر جزئیات متن در تصویر میشه. برخلاف مدل‌های تقطیر شده، نسخه بیس Z-Image بدون Distillation منتشر شده تا قابلیت CFG و استفاده از Negative Prompt به شکل کامل حفظ بشه. به نظر من، این حرکت برای مهندس‌هایی که دنبال Fine-tune کردن روی استایل‌های خاص هستن حیاتیه، چون مدل‌های تقطیر شده (Distilled) معمولاً انعطاف‌پذیری لازم برای یادگیری مفاهیم جدید رو ندارن و "پخته شده" به نظر می‌رسن.

آپدیت Qwen-Image-2512 روی نقاط ضعف کلاسیک مدل‌های نفوذی (Diffusion Models) یعنی رندر کردن متن (Typography) و رئالیسم انسانی تمرکز کرده. ارائه این مدل به صورت Diffusers-native یعنی زنجیره ابزارهای Python آماده پذیرش این مدل هستن و نیازی به بازنویسی اسکریپت‌های پیچیده استنتاج نیست. تمرکز روی جزئیات طبیعی نشون میده که رقابت از "ساختن تصویر کلی" به سمت "دقت در بافت" (Fine Detail) حرکت کرده و مدل‌ها دیگه توی کشیدن انگشت‌ها یا متون ریز کمتر سوتی میدن.

در حوزه ویدیو و مدل‌های جهان (World Models)، پروژه HY-WorldPlay از شرکت Tencent با انتشار کدهای آموزش و نسخه‌های بهینه شده، مسیر تعاملی کردن ویدیو رو هموار کرده. ارائه نسخه ۵ میلیاردی در کنار مدل ۸ میلیاردی نشون‌دهنده تلاش برای مدیریت VRAM در سیستم‌های محلیه. بهینه‌سازی‌های مهندسی مثل کوانتیزاسیون مستقیم در کد استنتاج، HY-WorldPlay رو از یه پروژه تحقیقاتی به یه ابزار کاربردی برای ساخت محیط‌های شبیه‌سازی شده و "Interactive Streaming" تبدیل کرده.

به نظر من، سال ۲۰۲۶ سالِ پیروزی مطلق DiT (Diffusion Transformers) بر معماری‌های قدیمی UNet هست. ترکیب Single-stream برای درک بهتر متن و تکنیک‌های Flow Matching برای سرعت بالاتر، داره فاصله بین تصور و خروجی رو به صفر می‌رسونه. اگه دنبال پایداری و کنترل هستید، Z-Image Base و اگه دنبال سرعت فضایی و دموهای لحظه‌ای هستید، FLUX.2 [klein] بهترین گزینه‌های روی میز هستن.

📃 مخزن FLUX.2 در گیت‌هاب:
https://github.com/black-forest-labs/flux2

📃 مدل Z-Image در هاگینگ فیس:
https://huggingface.co/Tongyi-MAI/Z-Image

📃 پروژه HY-WorldPlay در گیت‌هاب:
https://github.com/Tencent-Hunyuan/HY-WorldPlay

📃 مدل Qwen-Image-2512 در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen-Image-2512

🛠 Join @LLMEngineers Community
  • ❤ 4
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →