سال ۲۰۲۵ داره تموم میشه و اگه بخوایم کل امسال رو توی یه کلمه خلاصه کنیم، اون کلمه RLVR هست. کارپاتی (Andrej Karpathy) یه جمعبندی از سال ۲۰۲۵ نوشته که دقیقاً نشون میده چرا حسوحال مدلهای امسال (مثل OpenAI o3 و DeepSeek R1) با مدلهای قبلی فرق داره.
اینجا چکیده فنی و بدون حاشیه اتفاقات امسال رو براتون لیست کردم:
۱. تغییر پارادایم آموزش: ظهور RLVR
جدول زمانی آموزش LLMها به این شکل تغییر کرد:
سال ۲۰۲x: تمرکز روی Pre-training
سال ۲۰۲۲: تکنیک RLHF + PPO (دوران GPT-3.5)
سال ۲۰۲۳: بهینهسازی با LoRA SFT
سال ۲۰۲۴: تمرکز روی Mid-Training
سال ۲۰۲۵: جهش با RLVR + GRPO
تکنیک RLVR یا Reinforcement Learning from Verifiable Rewards بازی رو عوض کرد. برخلاف RLHF که روی "سلیقه انسان" استوار بود (که گرون و نادقیقه)، توی RLVR مدل رو توی محیطهایی که خروجی قابل تایید دارن (مثل ریاضی، کدنویسی و پازلهای منطقی) ول میکنن تا خودش استراتژی حل مسئله رو یاد بگیره.
نتیجه؟ مدلها یاد گرفتن "فکر کنن". اون چیزی که به اسم Reasoning Traces میبینیم، نتیجهی تلاش مدل برای ماکسیمایز کردن ریوارد در این محیطهای قابل تاییده. الان Scaling Law جدید روی "زمان فکر کردن" (Inference-time compute) تعریف میشه، نه فقط حجم دیتا.
۲. هوش دندانهدار (Jagged Intelligence)
ما با یه موجود بیولوژیک طرف نیستیم، با یه "روح احضار شده" طرفیم. هوش مدلهای ۲۰۲۵ به شدت نامتوازن هست.
توی حوزههایی که RLVR اعمال شده (ریاضی و کد)، مدلها نابغهن. اما توی حوزههایی که محیط Verifiable ندارن، هنوز میتونن مثل یه بچه دبستانی گیج بزنن یا با یه Jailbreak ساده فریب بخورن.
به نظر من، بنچمارکها توی ۲۰۲۵ رسماً بیارزش شدن. چون بنچمارکها ذاتاً محیطهای قابل تاییدن و مدلها ناخودآگاه (یا خودآگاه) روی اونها Overfit شدن. Goodhart's Law با تمام قدرت برقراره.
۳. لایه جدید نرمافزار: Vibe Coding و Cursor
سال ۲۰۲۵ سالی بود که "نوشتن کد" جای خودش رو به "توصیف رفتار" داد. کارپاتی اصطلاح Vibe Coding رو استفاده میکنه؛ یعنی شما با زبان طبیعی و حستون برنامه مینویسید و اصلا براتون مهم نیست زیر کاپوت چه کدی تولید شده.
اپلیکیشنهای یکبار مصرف (Ephemeral Apps) ترند شد. کدی که مینویسی تا یه باگ رو دیباگ کنی و بعد دور میریزی.
ابزارهایی مثل Cursor نشون دادن که لایه اپلیکیشن فقط "Wrap کردن API" نیست؛ بلکه Orchestration هوشمند، مدیریت Context و هندل کردن وابستگیهاست.
۴. ایجنتهای Localhost
با اومدن Claude Code، مفهوم ایجنت تغییر کرد. تا قبل از این فکر میکردیم ایجنتها قراره توی کانتینرهای ابری اجرا بشن، اما الان مشخص شد که "دسترسی و Context" مهمتر از قدرت پردازشیه.
اجرای ایجنت روی کامپیوتر خودت (Localhost) یعنی دسترسی به فایلها، ترمینال و محیط واقعی توسعهدهنده بدون تاخیر شبکه. این پارادایم خیلی منطقیتر از ایجنتهای ابریه.
۵. رابط کاربری Native
مدلهایی مثل Google Nano Banana نشون دادن که خروجی تکست، فرمت بهینه برای انسان نیست. ما دنبال تصویر، نمودار و UI هستیم. مدلهای جدید دارن یاد میگیرن که مستقیماً UI تولید کنن، نه اینکه تکست بدن و ما رندرش کنیم.
جمعبندی من:
ما هنوز توی فاز "پیدا کردن فرم فکتور" هستیم. مدلها همزمان هم خیلی باهوشتر از انتظارمون شدن (توی استدلال) و هم خیلی خنگتر (توی درک عمومی).
نکته کلیدی برای مهندسهای هوش مصنوعی اینه: تمرکزتون رو از روی Pre-training بردارید. الان بازی توی زمین Post-training، طراحی Reward Functionهای قابل اثبات و ارکستراسیون ایجنتهاست. کسی برنده است که بتونه این "هوش دندانهدار" رو توی یه سیستم قابل اطمینان کپسوله کنه.
📃 پست اصلی کارپاتی:
https://karpathy.bearblog.dev/year-in-review-2025/
🛠 Join @LLMEngineers Community
Post #284
1.78K