TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #283 1.53K
انتشار Gemini 3 Flash نشون داد که دیگه دوران مدل‌های کوچیکی که فقط نسخه‌ی ضعیف شده‌ی مدل‌های بزرگ (Distilled) بودن تموم شده. این مدل عملاً یه Frontier-class محسوب می‌شه که توی خیلی از بنچمارک‌های Reasoning، معلم خودش یعنی Gemini 3 Pro رو شکست داده. نکته‌ی طلایی این موفقیت، رویکرد Distillation Pretraining هست که تیم Google DeepMind با لیدری افرادی مثل Arnaud Autef پیاده کرده.

معماری Gemini 3 Flash بر پایه‌ی تحقیقاتی بنا شده که Autef قبلاً توی اپل روی مدل‌های Diffusion انجام داده بود. مقاله‌ی TRACT (مخفف Transitive Closure Time-Distillation) مشکل اصلی تقطیر (Distillation) سنتی یعنی Objective degeneracy رو حل کرد. در متدهای قدیمی، وقتی دانش رو از معلم به شاگرد منتقل می‌کردی، خطاها روی هم جمع می‌شدن و خروجی نهایی تار (Blur) می‌شد. تکنیک Transitive Closure به شاگرد اجازه می‌ده که چندین گام پردازشی معلم رو در یک حرکت "بپرونه" و همزمان با استفاده از یک Self-Teacher (EMA) پایداری آموزش رو حفظ کنه.

تکنولوژی Distillation Pretraining در این مدل یعنی برخلاف روال معمول که اول مدل رو می‌سازن و بعد دانش رو بهش تزریق می‌کنن، اینجا Loss تقطیر مستقیماً در فاز Pretraining ادغام شده. به نظر من این یعنی مدل از همون روز اول یاد می‌گیره چطوری مثل نسخه‌ی Pro استدلال کنه، نه اینکه صرفاً ادای اون رو دربیاره. نتیجه‌ش شده امتیاز ۷۸٪ روی SWE-bench Verified که حتی از Gemini 3 Pro با امتیاز ۷۶.۲٪ هم بالاتره. این یعنی شاگرد با حذف مسیرهای استدلالی اضافه، از معلمش بهینه‌تر و دقیق‌تر شده.

ویژگی‌های عملیاتی Gemini 3 Flash برای ما دولوپرها چند مورد کلیدی داره:

پارامتر thinking_level به شما اجازه می‌ده شدت تفکر مدل رو از Minimal تا High تنظیم کنید. این یعنی قابلیت Deep Think نسخه‌های سنگین، حالا با Latency بسیار پایین در دسترس هست.
تکنیک Context Forcing باعث شده حافظه‌ی شاگرد و معلم در طول فرآیند تولید متن کاملاً هم‌ترازو (Align) بمونه تا از Hallucination که معمولاً در زنجیره‌های طولانی Reasoning برای مدل‌های کوچیک پیش میاد، جلوگیری بشه.
سرعت این مدل ۳ برابر بیشتر از Gemini 2.5 Pro هست در حالی که از نظر عمق فهم مطلب، باهاش برابری می‌کنه.

واقعیت اینه که استراتژی DeepMind از Scaling خام (فقط بزرگتر کردن مدل) به سمت "علم آموزش" (Science of Training) شیفت کرده. اونا با Gemini 3 Flash تونستن Pareto frontier رو جابجا کنن؛ یعنی رسیدن به سطح هوش GPT-5 با هزینه‌ و پارامترهای خیلی کمتر. این یه برد بزرگ برای تیم پیش‌آموزش (Pretraining) به رهبری Vlad Feinberg هست که ثابت کردن فرمول درست تقطیر، مهم‌تر از تعداد GPUهاست.

به نظر من، Gemini 3 Flash پایان عصر مدل‌های سنگین و کند برای کارهای روزمره است. وقتی می‌تونی Reasoning در سطح Pro رو با سرعت چت واقعی داشته باشی، دیگه دلیلی برای تحمل Latency مدل‌های بزرگتر باقی نمی‌مونه.

📃 مقاله‌ی TRACT

🛠 Join @LLMEngineers Community
arXiv.org TRACT: Denoising Diffusion Models with Transitive Closure Time-Distillation Denoising Diffusion models have demonstrated their proficiency for generative sampling. However, generating good samples often requires many iterations. Consequently, techniques such as binary...
More from @llmengineers
  1. Oct 11, 2026توی یکی از پروژه‌هام با یه مشکل نسبتاً جدی روبه‌رو شدم: استخراج دقیق متن از PDFهای فارسی ب…
  2. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  3. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  4. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  5. Oct 7, 2026photo post
  6. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →