ایده اصلی خیلی سادهست: برای خیلی از کارهای نرمافزار اصلاً لازم نیست LLM شروع کنه به تولید متن. مثلاً وقتی فقط میخوای بدونی «این تیکت برای کدوم تیمه؟»، «کدوم Tool اجرا بشه؟»، «این نتیجه RAG مرتبطه؟» یا «Agent اجازه داره این کار رو انجام بده؟»، مدل میتونه مستقیماً احتمال گزینهها رو برگردونه و کد بر اساس همون تصمیم بگیره. Cloudflare همین الگو رو برای دستهبندی درخواست پشتیبانی و حتی تشخیص نوع سایتها توضیح داده و Knowviq هم Decision Modelها رو برای سنجش ارتباط نتایج، پشتیبانی جملهها با شواهد و تشخیص قابلپاسخبودن سؤال استفاده کرده.
https://blog.cloudflare.com/clef-decision-models
چیزی که این چند روز جالبتر شده، رقابت شدید روی مدلهای بازه. کلودفلر Clef و Clef-flash رو با Apache 2.0 منتشر کرده؛ خانواده Decision 2.0 از vLLM هم از 0.6B تا 27B میره و میتونه تا ۶۴ سؤال درباره یک ورودی رو در یک Forward Pass جواب بده. حتی Julia-1 فقط 144M پارامتر داره، یعنی برای خیلی از دستهبندیها و مسیردهیهای ساده شاید اصلاً مدل چندمیلیاردپارامتری لازم نباشه.
از اون طرف llama.cpp در نسخه 0.6.0 یه endpoint جدید به اسم
/v1/systemone اضافه کرده و چند مدل مثل OpenJev، Julia، Kev، Lev و Laya رو محلی اجرا میکنه؛ Clef هم با متن و تصویر پشتیبانی شده. یعنی این مدلها دیگه فقط API ابری نیستن و میشه بخشی از تصمیمهای حساس رو کاملاً روی سیستم خودمون نگه داشت. یه مسیر متفاوت هم داره شکل میگیره: «فکر بیشتر» بدون تولید Token بیشتر. GLiDE وقتی بین گزینهها مطمئن نباشه محاسبه بیشتری اختصاص میده، و RSI-Jev v6.0-VL حتی عمق شبکه رو برای هر تصمیم تغییر میده؛ نسخه 4B اون میتونه بسته به سختی سؤال در لایه 16، 20 یا 32 متوقف بشه و امتیاز گزارششدهاش در Decision Index از 38.38 به 46.24 رسیده.
خود Decision Index هم الان داره تبدیل به یکی از محلهای اصلی مقایسه این مدلها میشه، ولی رتبهبندی هنوز خیلی سیاله. مثلاً Fastino برای GLiDE امتیاز 64.81 گزارش کرده و Cloudflare هم در زمان انتشار Clef اون رو صدرنشین معرفی کرده؛ این اعداد از روشهای ارزیابی متفاوت و بعضاً گزارش خود سازندهها میان، پس نباید ازشون یه جدول قطعی «بهترین مدل» ساخت.
https://huggingface.co/spaces/multimodalart/jev-decision-index
🛠 Join @LLMEngineers Community