TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #433 1.82K
پروژه OpenBench v1 برای ارزیابی و بنچمارک دقیق ایجنت‌های کدنویسی منتشر شد... ابزاری متن‌باز که روی مقایسه و سنجش harnessها تمرکز داره.

اکثر تیم‌ها تمام تمرکز رو روی انتخاب مدل گذاشتن - اما یک ایجنت کدنویسی حاصل ترکیب مدل و harness است؛ یعنی همون ابزارهای جانبی، پرامپت‌ها، دسترسی‌ها و سیستم مدیریت اجرای اطراف مدل. وقتی مدل یکسان باشه (مثلاً gpt-5.6)، تغییر دادن harness از cursor به codex، claude یا devin می‌تونه درصد موفقیت و هزینه‌ها رو کلاً تغییر بده.

معیارهای سنجش توی این فریم‌ورک روی سه محور اصلی میچرخه: درصد درستی (correctness)، میزان مصرف token (ورودی، خروجی و cache) و تاخیر زمانی (latency)... ارزیابی‌ها هم داخل کانتینرهای ایزوله Docker اجرا میشن و صحت کد با اسکریپت‌های checker مستقل ارزیابی میشه، نه ادعای خود ایجنت.

https://github.com/minghinmatthewlam/openbench

🛠 Join @LLMEngineers Community
  • 👍 4
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →