مدل VibeThinker-3B با ادعای شکست دادن غولهایی مثل Gemini 3 Pro و DeepSeek توی ریاضی و کدنویسی، دوباره بحث "فشردهسازی استدلال" رو داغ کرده. حرف اصلیشون اینه که برای Reasoning برخلافِ دانش عمومی (Knowledge)، لزوماً به صدها میلیارد پارامتر نیاز نداریم و میشه منطق رو توی یه هسته ۳ میلیاردی جا داد.
توی پایپلاین post-training از یه استراتژی به اسم Spectrum-to-Signal استفاده کردن که با RL سنگین و SFT مرحلهبندی شده، مدل رو روی تسکهای Verifiable (اونایی که جواب قطعی دارن) متمرکز میکنه. عددها روی AIME و LiveCodeBench خیرهکنندهست، ولی طبق معمول نباید فریب بنچمارک رو خورد.
واقعیت اینه که این مدلها معمولاً برای بنچمارک بهینه (Benchmax) میشن و توی سناریوهای واقعی یا دچار Overthinking میشن یا کلاً گیج میزنن. با این حال، اگه این فرضیه که استدلال یه قابلیت چگال و قابل فشردهسازیه واقعاً در عمل ثابت بشه، مسیر توسعه SLMها کلاً عوض میشه.
Source: https://arxiv.org/abs/2606.16140
🛠 Join @LLMEngineers Community
Post #349
1.58K