👉 @navidcasts 🎓
لینک مقاله : https://arxiv.org/pdf/2402.03300
این منبع، مدل زبان بزرگ متنباز جدیدی به نام DeepSeekMath 7B را معرفی میکند که مرزهای توانایی استدلال ریاضی را جابهجا کرده است.
👉 @navidcasts 🎓
این مدل با پیشآموزش مستمر بر روی ۱۲۰ میلیارد توکن مرتبط با ریاضیات که با دقت از دادههای عمومی وب (Common Crawl) استخراج شدهاند، به دقت ۵۱.۷% در معیار رقابتی MATH دست یافته که قابل مقایسه با مدلهای بسته مانند Gemini-Ultra و GPT-4 است.
👉 @navidcasts 🎓
علاوه بر دادههای مقیاس بزرگ و باکیفیت، نویسندگان از یک الگوریتم یادگیری تقویتی کارآمد و کمهزینه به نام Group Relative Policy Optimization (GRPO) استفاده کردهاند تا عملکرد مدل را بهبود بخشیده و نشان دهند که آموزش کد، توانایی استدلال ریاضی را تقویت میکند.
👉 @navidcasts 🎓
بهطور کلی، این مقاله رویکردهای نوآورانه در جمعآوری داده و بهینهسازی مدل را برای ارتقاء چشمگیر قابلیتهای ریاضی مدلهای زبان متنباز تشریح میکند.
Post #34
147