دیتابریکس یه بنچمارک داخلی روی کدبیس چند میلیون خطی خودش زده که نتایجش برای منی که مدام درگیر چیدن پایپلاینهای Coding Agent هستم، خیلی واقعیتر از متریکهای فیک SWE-bench بود... راستش همیشه فکر میکردیم مدل گرونتر یعنی نتیجه بهتر، ولی خروجی این تحقیق نشون داد قیمت Token معیار خیلی بدی برای پیشبینی هزینه نهایی تسکه. مدلهای بزرگتر شاید قیمت هر توکنشون بالا باشه، ولی چون Reasoning قویتری دارن، با توکن کمتر و تعداد دفعات رفتوبرگشت (Turn) کوتاهتری تسک رو تموم میکنن. مثلاً Opus تو بعضی سناریوها از Sonnet ارزونتر تموم شده، صرفاً چون کمتر گیج زده و توکن کمتری مصرف کرده...
بحث Harness یا همون محیطی که Agent توش اجرا میشه هم از خود مدل مهمتر نباشه، کمتر نیست. دیتابریکس ابزار Pi رو با Claude Code مقایسه کرده؛ Pi چون Context رو هوشمندانه مدیریت میکنه و هر بار کل دیتا رو به خورد مدل نمیده، هزینهش گاهی تا ۵۰ درصد کمتر بوده، بدون اینکه دقتش افت کنه. یعنی اگه ابزارت مدیریت Context درستی نداشته باشه، بهترین مدل دنیا رو هم داشته باشی فقط پولت رو دور ریختی...
نکته جالب دیگه، عملکرد مدلهای Open بود. مدل GLM 5.2 قشنگ اومده تو سطح اول کنار غولها نشسته. برای تسکهای روزمره که پیچیدگی وحشتناکی ندارن، استفاده از مدلهایی مثل Haiku یا GPT-4o Mini به جای مدلهای سنگین، کارایی تیم رو بدون هزینه اضافی برده بالا. دیتابریکس تسکها رو از توی PRهای واقعی خودشون درآورده بود
لینک جزئیات متدولوژی و پلاتهای مقایسهای رو اینجا ببینید:
databricks.com/blog/benchmarking-coding-agents-multi-million-line-codebase
🛠 Join @LLMEngineers Community
Post #400
1.68K
- 👍 7
- ❤ 3
- 👨💻 1