انتشار Gemini 3 Flash نشون داد که دیگه دوران مدلهای کوچیکی که فقط نسخهی ضعیف شدهی مدلهای بزرگ (Distilled) بودن تموم شده. این مدل عملاً یه Frontier-class محسوب میشه که توی خیلی از بنچمارکهای Reasoning، معلم خودش یعنی Gemini 3 Pro رو شکست داده. نکتهی طلایی این موفقیت، رویکرد Distillation Pretraining هست که تیم Google DeepMind با لیدری افرادی مثل Arnaud Autef پیاده کرده.
معماری Gemini 3 Flash بر پایهی تحقیقاتی بنا شده که Autef قبلاً توی اپل روی مدلهای Diffusion انجام داده بود. مقالهی TRACT (مخفف Transitive Closure Time-Distillation) مشکل اصلی تقطیر (Distillation) سنتی یعنی Objective degeneracy رو حل کرد. در متدهای قدیمی، وقتی دانش رو از معلم به شاگرد منتقل میکردی، خطاها روی هم جمع میشدن و خروجی نهایی تار (Blur) میشد. تکنیک Transitive Closure به شاگرد اجازه میده که چندین گام پردازشی معلم رو در یک حرکت "بپرونه" و همزمان با استفاده از یک Self-Teacher (EMA) پایداری آموزش رو حفظ کنه.
تکنولوژی Distillation Pretraining در این مدل یعنی برخلاف روال معمول که اول مدل رو میسازن و بعد دانش رو بهش تزریق میکنن، اینجا Loss تقطیر مستقیماً در فاز Pretraining ادغام شده. به نظر من این یعنی مدل از همون روز اول یاد میگیره چطوری مثل نسخهی Pro استدلال کنه، نه اینکه صرفاً ادای اون رو دربیاره. نتیجهش شده امتیاز ۷۸٪ روی SWE-bench Verified که حتی از Gemini 3 Pro با امتیاز ۷۶.۲٪ هم بالاتره. این یعنی شاگرد با حذف مسیرهای استدلالی اضافه، از معلمش بهینهتر و دقیقتر شده.
ویژگیهای عملیاتی Gemini 3 Flash برای ما دولوپرها چند مورد کلیدی داره:
پارامتر thinking_level به شما اجازه میده شدت تفکر مدل رو از Minimal تا High تنظیم کنید. این یعنی قابلیت Deep Think نسخههای سنگین، حالا با Latency بسیار پایین در دسترس هست.
تکنیک Context Forcing باعث شده حافظهی شاگرد و معلم در طول فرآیند تولید متن کاملاً همترازو (Align) بمونه تا از Hallucination که معمولاً در زنجیرههای طولانی Reasoning برای مدلهای کوچیک پیش میاد، جلوگیری بشه.
سرعت این مدل ۳ برابر بیشتر از Gemini 2.5 Pro هست در حالی که از نظر عمق فهم مطلب، باهاش برابری میکنه.
واقعیت اینه که استراتژی DeepMind از Scaling خام (فقط بزرگتر کردن مدل) به سمت "علم آموزش" (Science of Training) شیفت کرده. اونا با Gemini 3 Flash تونستن Pareto frontier رو جابجا کنن؛ یعنی رسیدن به سطح هوش GPT-5 با هزینه و پارامترهای خیلی کمتر. این یه برد بزرگ برای تیم پیشآموزش (Pretraining) به رهبری Vlad Feinberg هست که ثابت کردن فرمول درست تقطیر، مهمتر از تعداد GPUهاست.
به نظر من، Gemini 3 Flash پایان عصر مدلهای سنگین و کند برای کارهای روزمره است. وقتی میتونی Reasoning در سطح Pro رو با سرعت چت واقعی داشته باشی، دیگه دلیلی برای تحمل Latency مدلهای بزرگتر باقی نمیمونه.
📃 مقالهی TRACT
🛠 Join @LLMEngineers Community
Post #283
1.53K