Post #507 1.79K Sep 15, 2026, 10:16 UTC روند بکارگیری یادگیری تقویتی (RL) در بهبود عملکرد مدلهای زبانی (LLMs) :https://telegra.ph/RL-in-LLMs-09-14 Telegraph RL in LLMs توی Pipeline آموزش LLMهای جدید، RL دیگه فقط اون مرحلهی آخر برای alignment نیست. الان مستقیم برای ساختن reasoning، کدنویسی، سرچ و قابلیتهای ایجنتی استفاده میشه. برای یه AI Engineer هم به نظرم مهمترین تغییر همینجاست: دیگه فقط نباید بدونیم PPO بهتره یا… 🔥 3 ❤ 1