نتایج تحقیقات استنفورد: چرا دولوپر هنوز نمیتونند کامل به AI اعتماد کنند؟
دانشگاه Stanford بهتازگی یه دیتاست خیلی جالب منتشر کرده از سشنهای واقعیِ coding-agentها روی ریپازیتوریهای عمومی گیتهاب. این دیتاست حدود ۶ هزار سشن، ۶۳ هزار پرامپت کاربر، ۳۵۵ هزار tool call، تغییرات متصل به git و حتی مشخص میکنه که هر خط کد رو انسان نوشته یا ایجنت.
نکته جالب اینه که استفاده از coding-agentها داره خیلی دو قطبی میشه؛ حدود ۴۱٪ سشنها عملاً «vibe coding» هستن، یعنی تقریباً تمام کدهای commitشده رو خود ایجنت نوشته، در حالی که ۲۳٪ سشنها هنوز کاملاً انسانی هستن.
اما مهمترین نتیجه این تحقیق اینه که این ابزارها وقتی در دنیای واقعی استفاده میشن، هنوز هم هم ناکارآمدن و هم ریسک بالایی دارن. فقط حدود ۴۴٪ کدهایی که ایجنتها تولید میکنن در نهایت وارد commit نهایی میشه، کاربران تقریباً در ۴۴٪ مراحل یا جلوی ایجنت رو میگیرن یا مسیرش رو عوض میکنن، و commitهایی که با vibe coding ساخته شدن، نسبت به کدنویسی کاملاً انسانی یا همکاری انسان و ایجنت، آسیبپذیریهای امنیتی بیشتری دارن که توسط ابزار Semgrep شناسایی شده.
برای کسایی که روی ساخت coding-agent، سیستمهای ارزیابی، IDE copilotها یا ابزارهای داخلی توسعه کار میکنن، این تحقیق یه یادآوری مهمه: احتمالاً مدل برنده، خودمختاری کامل ایجنتها نیست، بلکه ساختن ابزارها و چارچوبهای کمکی بهتر در کنار ایجنتهاست.
@DevTwitter | <Reza Jafari/>
Post #12080
6.94K
- 👍 39
- ❤ 7
- 💔 6