دوره جدید استنفورد با موضوع ایجنتهای خود بهبود دهنده (Self-Improving AI Agents) دست روی یکی از بنیادیترین تغییرات پارادایم هوش مصنوعی گذاشته.
تا الان تمرکز اصلی صنعت روی بزرگتر کردن مدلها در مرحله پیشآموزش (Pre-training) بود. اما مدرسین دوره که از اساتید استنفورد و محققان سابق DeepMind و Anthropic هستن، نشون میدن که این مسیر به تنهایی دیگه جوابگو نیست و آینده دست ایجنتهایی هست که میتونن خودشون رو اصلاح کنن.
سه محور اصلی که این تحول روی اونها شکل میگیره:
۱. پردازش در زمان استنتاج (Test-time Compute): به جای پاسخ لحظهای، ایجنت فرصت تفکر، جستجو در فضای حل مسئله و بررسی راهحلهای مختلف رو پیدا میکنه.
۲. بازخورد قابل راستیآزمایی (Verifiable Feedback): استفاده از محیطهای واقعی مثل کامپایلرها، اجرای کد و تستهای نرمافزاری تا ایجنت خروجی خودش رو ارزیابی کنه نه اینکه فقط متن تولید کنه.
۳. حلقههای خوداصلاحی (Self-Correction & Reflection): طراحی pipelineهایی که ایجنت بتونه دلیل شکست در یک کار رو تحلیل کنه و در تلاش بعدی بدون نیاز به انسان، خطاش رو برطرف کنه.
در واقع شیفت اصلی از «مدلهای ایستا» به سمت «سیستمهای پویای یادگیرنده» است.
Youtube: https://youtube.com/watch?v=6YnLB0XbTnI
@DevTwitter | <Mehdi Allahyari/>
Post #12735
6.93K
- ❤ 18
- 👍 3