یه مدل جایگزین مدل معروف Jev اومده که میگه 9 برابر سریع تر استنتاج میکنه، در حالی که توی کارهایی مثل کار با کامپیوتر، گیمینگ و Tool Calling عملکردی در حد Jev داره.
اسمش CLM-8B هستش و ایده اصلیش اینه که بهجای پردازش دوباره همهچیز، State و Action رو از هم جدا میکنه تا بتونه Embeddingهاشون رو جداگانه Cache کنه و دوباره استفاده کنه. این یعنی وقتی محیط مدام تغییر میکنه ولی Actionهای ممکن ثابت میمونن، کلی محاسبه اضافه حذف میشه.
جالبتر اینکه با یه Fine-tuning سبک، روی بنچمارکهای سخت Agentic Coding به 81.6% توی DeepSWE و 87.6% توی Terminal-Bench 2.1 رسیده و ادعای SOTA داده. یعنی فقط بحث سرعت نیست و برای Coding Agentهای چندمرحلهای هم عملکرد جدیای داره.
تیم سازنده در نهایت Scaling Lawهای CLM رو هم بررسی کرده و نشون داده Contrastive Loss با افزایش Compute، اندازه مدل و اندازه دیتاست، به شکل قابلپیشبینی کاهش پیدا میکنه. خلاصه اینکه ایده اصلی CLM اینه: State و Action رو از هم جدا کن، Cache کن و با هزینه خیلی کمتر و سرعت بالاتر تصمیم بگیر:
github.com/Contrastive-LM/CLM
@Linuxor
Post #5411
7.33K