بهجای اینکه فقط جدولهای بنچمارک رو ببینیم، بعضی سایتها مدلهای جدید رو میبرن سراغ کارهای واقعی؛ از کدنویسی و ساخت وبسایت گرفته تا کار با کامپیوتر و حل Issueهای واقعی GitHub.
چند سایت که ارزش Bookmark کردن دارن
LMArena
مدلها در کارهای واقعی با هم رقابت میکنن و کاربران خروجیها رو مقایسه و رأی میدن. بخشهای Coding، WebDev و Agent هم داره.
SWE-bench
مدلها باید Issueهای واقعی GitHub رو حل کنن، کد رو تغییر بدن و تستهای پروژه رو پاس کنن. یکی از منابع مهم برای مقایسه Coding Agentها.
Terminal-Bench
اینجا Agentها باید کارهای واقعی و چندمرحلهای رو داخل Terminal انجام بدن؛ نه اینکه فقط یک جواب متنی تولید کنن.
OSWorld
برای مقایسه مدلهایی که میتونن مثل یک کاربر با کامپیوتر کار کنن؛ باز کردن برنامهها، کلیک کردن، انجام وظایف چندمرحلهای و...
Artificial Analysis
برای دنبال کردن مدلهای جدید و مقایسهی کیفیت، سرعت، قیمت، latency و مشخصات مختلف مدلها.
اگر دنبال مدلهای جدید هستی، فقط به یک Leaderboard اکتفا نکن. مثلاً ممکنه یک مدل در کدنویسی عالی باشه ولی در Computer Use یا Web Research عملکرد متفاوتی داشته باشه.
@ITSecurityComputer