مدل Step 3.5 Flash از تیم StepFun یکی از جدیترین تلاشها برای بهینهسازی مدلهای زبانی در چرخههای عاملیت (Agent Loops) محسوب میشه. این مدل با معماری MoE و مجموع ۱۹۶ میلیارد پارامتر طراحی شده، اما در زمان استنتاج فقط ۱۱ میلیارد پارامتر فعال (Active Parameters) داره. این یعنی داریم با مدلی کار میکنیم که دانش یک غول ۲۰۰ میلیاردی رو داره ولی با سرعت و هزینه یک مدل سبک ۱۱ میلیاردی اجرا میشه.
معماری Interleaved 3:1 Sliding-window / Full Attention یک حرکت مهندسی هوشمندانه برای مدیریت Context است. در این ساختار، به جای استفاده از Full Attention در تمام لایهها که هزینه محاسباتی رو به شدت بالا میبره، از ترکیب ۳ به ۱ پنجرههای لغزان (Sliding-window) و توجه کامل استفاده شده. این یعنی مدل هم ارتباطات محلی رو خیلی سریع میفهمه و هم هر چند لایه یک بار، دید کلی (Global) پیدا میکنه. برای ایجنتهایی که نیاز به پردازش تاریخچه طولانی چت دارن، این یعنی تعادل بین دقت و سرعت.
پایپلاین RL این مدل هم از سیگنالهای قابل تایید (Verifiable Signals) و بازخورد ترجیحی (Preference Feedback) به صورت ترکیبی استفاده میکنه. برخلاف روشهای سنتی RLHF که فقط روی سلیقه انسانی تمرکز دارن، اینجا مدل بر اساس درستی خروجی (مثلاً اجرای کد یا حل ریاضی) هم جریمه یا تشویق میشه. این پایداری در آموزش Off-policy باعث شده که مدل در سناریوهای دنیای واقعی کمتر دچار توهم بشه و رفتارهای منطقیتری از خودش نشون بده.
به نظر من، Step 3.5 Flash نشون داد که دوران مدلهای General-purpose که فقط برای چت کردن ساخته میشدن تموم شده. ما الان نیاز به مدلهایی داریم که برای "کار انجام دادن" (Task Execution) بهینه شده باشن. تمرکز روی زیرساخت RL پایدار و معماری هیبریدی Attention، این مدل رو به یکی از بهترین گزینهها برای دیپلوی کردن سیستمهای Agentic در سال ۲۰۲۶ تبدیل کرده.
📃 مقاله فنی در arXiv:
https://arxiv.org/abs/2602.10604
📃 مخزن کد در گیتهاب:
https://github.com/stepfun-ai/Step-3.5-Flash
📃 مدل در هاگینگ فیس:
https://huggingface.co/stepfun-ai/Step-3.5-Flash
🛠 Join @LLMEngineers Community
Post #299
1.06K