📊 بهرهوری توکن در Agent Arena
بنچ مارک Agent Arena عملکرد ایجنتهای هوش مصنوعی رو روی تسکهای واقعی (نوشتن کد، ساخت اسلاید، تحقیق وب، توسعه اپ، تحلیل اسناد) با ابزارهای search، filesystem و terminal میسنجه.
نکته کلیدی اینه که مصرف توکن بیشتر همیشه به کیفیت بهتر منجر نمیشه. این نمودار هر مدل را نشون میده
بهبود عملکرد (عمودی) در برابر میانه توکن مصرفی (افقی) — و یک خط روند کلی ترسیم میکنه. فاصله از این خط، بخش جالب ماجراست.
یافتهها:
✅مدل Opus با توکن کمتر کیفیت بالاتری میده. Fable با +۱۴.۱٪ بهترین کیفیت رو داره، در برابر +۹.۲٪ برای Opus 4.8 Thinking با مصرف توکن مشابه.
✅ هر سه مدل GPT-5.5 (بین +۶.۲٪ تا +۸.۶٪) بالای خط بهرهوری قرار دارن، با توکن کمتر از مدلهای پیشروی Claude.
✅ مدل GLM-5.2 با +۵.۱٪ تقریباً دقیق روی خط روند قرار میگیره.
⚠️ توکن مساوی بازده نیست: Gemini-3.5 Flash بیشترین توکن رو مصرف میکنه ولی فاصله زیادی تا فرانتیر داره، و Grok Build 0.1 با ۲۰هزار+ توکن، بهبود منفی نشون میده.
⚠️ گوشه پایین-چپ (مصرف کم، بازده کم): Grok-4.3، Nemotron 3 Ultra و Gemma-4 31B.
@cvision
Post #4331
5.15K

- ❤ 6
- ❤🔥 2