امروز Jev 1.13 رو از طریق API رسمی OpenRouter آزمایش کردم، و نتیجهاش بیشتر از چیزی که انتظار داشتم جالب بود.
روی دیتاست MASSIVE با ۵٬۹۴۸ جملهی فارسی و انگلیسی و ۶۰ نوع Intent، چهارده مدل رو روی یک دادهی یکسان مقایسه کردم. بر اساس دقت:
- اول، E5 Base با Logistic Regression: ۸۳٫۷۹٪+
- دوم، TF-IDF با Logistic Regression: ۸۲٫۴۸٪+
- سوم، Decider-2B: ۸۱٫۶۴٪
- بعد، E5 Small: ۸۰٫۹۰٪
- بعد، Jev 1.13: ۷۹٫۸۶٪
- بعد، Decider-0.8B: ۷۶٫۷۷٪
- آخر، Kev-0.8B: ۵۷٫۹۵٪
یعنی یک مدل امبدینگ ۲۷۸ میلیونی از مدلهای تخصصی تصمیمگیری جلوتر افتاد، و TF-IDF هم هنوز از Jev و Decider دقیقتر بود.
حالا راز E5 چیه؟ از مدل چندزبانهی E5 استفاده کردم تا متن رو به بردارهای ۷۶۸بعدی تبدیل کنه و فقط یک Logistic Regression ساده روی خروجیاش آموزش دادم. هیچکدوم از پارامترهای E5 رو دوباره آموزش ندادم.
ولی یک نکتهای هست که نباید از قلم بیفته: من برای E5 و TF-IDF از بیش از ۲۳ هزار نمونهی آموزشی برچسبدار استفاده کردم، درحالیکه Jev و Decider بدون آموزش و بهصورت Zero-shot ارزیابی شدن. پس این نتایج ثابت نمیکنه E5 یک موتور تصمیمگیری عمومی قویتره.
از Jev یک نتیجهی غیرمنتظره هم درآمد. اگر بهجای Accuracy از Macro-F1 استفاده کنیم، مقایسه برعکس میشه: Jev به ۷۷٫۳۲٪ میرسه و Decider-2B به ۷۶٫۲۵٪. چون Macro-F1 به همهی کلاسها وزن یکسان میده، یعنی Jev با وجود دقت کلی پایینتر، بین دستههای مختلف متعادلتر بوده.
کالیبراسیون هم داستان جداگانهای داشت. خطای کالیبراسیون یا ECE برای Decider-2B حدود ۰٫۰۱۸۶، برای Jev حدود ۰٫۰۵۰۹ و برای E5 Base حدود ۰٫۲۵۷۳ دراومد. هرچه ECE کمتر باشه یعنی اطمینان پیشبینیشده به دقت واقعی نزدیکتره. البته ECE همهچیز رو نشون نمیده؛ E5 با وجود خطای بالاتر، توی آزمایش من در رتبهبندی تصمیمها بر اساس ریسک بهتر عمل کرد.
از نظر هزینه و سرعت هم، اجرای کامل Jev روی هر ۵٬۹۴۸ جمله حدود ۰٫۲۹۳ دلار شد و میانهی زمان پاسخ هم حدود ۶۲۶ میلیثانیه.
یک نکتهی دیگه هم این بود که در دو اجرای مستقل روی ۳۹۸ ورودی مشترک، حدود ۲٫۳ درصد پیشبینیهای Jev تغییر کرد. یعنی نتیجهی یک اجرای منفرد رو نباید خیلی قطعی گرفت.
دارم هنوز تست میکنم این مدل هارو، مرحله بعدی هدفم دیگه فقط تشخیص Intent نیست؛ میخوام ببینم Encoderهای کوچک و چندزبانه میتونن توی ۵۰ کاربرد مختلف، از انتخاب ابزار و کنترل Agent تا ارزیابی RAG و تصمیمگیری چندمرحلهای، با مدلهای تصمیم گیری تخصصی مث Jev رقابت کنن یا نه.
درسی که خودم از این آزمایش گرفتم اینه: برای حل یک مسئلهی مشخص، همیشه مدل بزرگتر لازم نیست. یک Encoder ازپیشآموزشدیده کنار یک الگوریتم کلاسیک میتونه نتیجهی چشمگیری بده. ولی تشخیص یک دستهی ازپیشتعریفشده با تصمیمگیری دربارهی مسئلهای کاملاً جدید، دو تا مسئلهی متفاوتن.
🛠 Join @LLMEngineers Community
Post #522
2.01K
- 👍 11
- ❤ 4
- 🔥 2