پروژه OpenBench v1 برای ارزیابی و بنچمارک دقیق ایجنتهای کدنویسی منتشر شد... ابزاری متنباز که روی مقایسه و سنجش harnessها تمرکز داره.
اکثر تیمها تمام تمرکز رو روی انتخاب مدل گذاشتن - اما یک ایجنت کدنویسی حاصل ترکیب مدل و harness است؛ یعنی همون ابزارهای جانبی، پرامپتها، دسترسیها و سیستم مدیریت اجرای اطراف مدل. وقتی مدل یکسان باشه (مثلاً gpt-5.6)، تغییر دادن harness از cursor به codex، claude یا devin میتونه درصد موفقیت و هزینهها رو کلاً تغییر بده.
معیارهای سنجش توی این فریمورک روی سه محور اصلی میچرخه: درصد درستی (correctness)، میزان مصرف token (ورودی، خروجی و cache) و تاخیر زمانی (latency)... ارزیابیها هم داخل کانتینرهای ایزوله Docker اجرا میشن و صحت کد با اسکریپتهای checker مستقل ارزیابی میشه، نه ادعای خود ایجنت.
https://github.com/minghinmatthewlam/openbench
🛠 Join @LLMEngineers Community
Post #433
1.82K
- 👍 4