چیزی که تو معماریش واسم جالب بود بحث Continuous Reasoning Effort هست. جای اینکه مثل بقیه مدلها فقط چند تا مود ثابت واسه ریزونینگ داشته باشه، یه پارامتر بین صفر و یک میگیره. من رو ۰.۷ تنظیمش کردم واسه تسکهای روتین، و فقط وقتی میخوام یه کد پیچیده رو دیباگ کنه میذارمش رو ۰.۹۹. اینطوری هم توکن کمتری مصرف میشه هم سرعت ریسپانس خیلی بالاتره، چون مدل مجبور نیست رو سوالهای ساده پردازش الکی انجام بده.
واسه فاینتیون کردنش هم داکیومنتهای پلتفرم Tinker یه سری دیتای خوب داده که به درد پروژههای دیگه هم میخوره. نوشتن اگه میخواید رو این مدلهای اسپارس MoE لورا بزنید، فقط تارگت کردن لایههای اتنشن جواب نمیده. باید وزنهای LoRA رو روی تمام ماتریکسها، از جمله MLP و خود لایههای MoE اعمال کنید. رنک دیفالت رو ۳۲ پیشنهاد دادن و گفتن لرنینگ ریت رو حدود ۱۰ برابر زمانی بذارید که دارید فولفاینتیون میکنید. این ستاپ واسه SFT و حتی RL روی دیتای کاستوم بهترین نتیجه رو داده.
واقعیتش مدلی که من منتظرشم این نسخه ۹۷۵ میلیاردی نیست. تو پیشنمایشهاشون حرف از Inkling-Small زدن که کلا ۲۷۶ میلیارد پارامتر داره و فقط ۱۲ میلیاردش تو هر توکن اکتیوه. بنچمارکهاش تو پردازش صدا و ریکوئستهای ایجنتیک تقریبا همسطح برادر بزرگترشه ولی هنوز وزنهاش رو پابلیک نکردن...
گزارش کامل وضعیت ساپورت نرمافزاری و بررسی بنچمارکهای نسخه کوچیکتر:
https://thinkingmachines.com/inkling-technical-ecosystem
🛠 Join @LLMEngineers Community
Post #417
1.43K
AI Engineers Inkling