👉 @ai_python ✍️
alphaxiv.org/pdf/2512.16649
یادداشتِ گروک : این توییت، مقالهای به نام «JustRL: Scaling a 1.5B LLM with a Simple RL Recipe» را معرفی میکند. این مقاله یک روش ساده و تکمرحلهای یادگیری تقویتی (RL) با هایپرپارامترهای ثابت را توصیف میکند که مدلهای زبان بزرگ با ۱.۵ میلیارد پارامتر را به سطح عملکرد استیتآفدآرت در استدلال (reasoning) میرساند.
👉 @ai_python ✍️
این روش روی دو مدل پایه (DeepSeek و Nemotron) میانگین دقت ۵۴.۹٪ و ۶۴.۳٪ را در نه بنچمارک ریاضی به دست آورده، در حالی که با ۲ برابر محاسبات کمتر نسبت به روشهای پیچیدهتر کار میکند و بهبودهای مداوم و بدون توقف (plateau) یا فروپاشی (collapse) را در بیش از ۴۰۰۰ گام نشان میدهد.
نویسندگان استدلال میکنند که خطوط لوله چندمرحلهای پیچیده و تنظیمات پویا اغلب غیرضروری هستند و مدلها و کد خود را به عنوان یک پایه پایدار برای جامعه تحقیقاتی منتشر کردهاند.
Post #18153
1.88K

- ❤ 9
- 👍 5