چرا حس میکنیم هر مدل جدیدی که میاد، انقدر از مدلهای قدیمی قدرتمندتره؟
باید بگم که این بیشتر از منطقی بودن، «کلک» شرکتهاست برای مارکتینگ
اگه یادتون باشه، 2 هفته پیش همهی این بنچمارکها(خصوصا سه بعدی) جوری از GPT Astra تعریف میکردن و چیزای خفن میساختن که انگار خدای همهی مدلهاست.
بعد که Claude Opus 5.5 اومد، خروجیهاش رو جوری نشون دادن انگار اون مقابلش پیامبره.
حالا این قضیه برای هر دوی اونا در مورد Gemini 4 Pro داره تکرار میشه
به این کار اکانتهای بنچمارک و Ai Enthusiast ، قضیهی Strawman Fallacy میگن. یعنی مغالطهی آدمکِ پوشالی
توی فلسفه، Strawman fallacy یعنی از رقیب قدرتمندت، یه فرض پوشالی بسازی جلوی مخاطب، شکستش بدی، و بعد خودت رو پیروز جلوه بدی
هم خود کمپانیها، هزینه میکنن که اکانتهای توییتری/ردیتی این کار رو انجام بدن؛ هم خود آدما خیلی وقتا این کارو سر هایپ و ... انجام میدن.
چه شکلی انجام میشه؟
1- مدل رقیب با پرامپت ساده یا بد تست میشه، ولی مدل خودشون با پرامپت بهینهشده.
2- قابلیتهای رقیب مثل reasoning، ابزارها یا context بلند خاموش میشه.
3- هایپرپارامترهای رقیب به درستی تنظیم نمیشه ولی مال خودشون با دقت tune میشه.
این شکلیه که میگم هیچوقت به بنچمارکهای این شکلی توییتری، نمیشه اعتماد کرد.
✉️
t.me/MatinSenPaii