چیزی که توی موج Open Sourceهای Jev جالبه اینه که بیشتر پروژهها اصلاً سعی نکردن معماری جدیدی از صفر بسازن؛ رفتن سراغ یه LLM آماده و فقط روش خروجی تصمیمگیری ساختن. یعنی بهجای اینکه Qwen یا Gemma متن تولید کنه، مستقیم احتمال گزینهها از داخل مدل خونده میشه.
مثلاً SemIf از Qwen3.5-4B استفاده میکنه، system-one-open روی Gemma ساخته شده و OpenJev سراغ DiffusionGemma رفته. مزیت این مسیر واضحه: دانش و درک زبانی LLM رو تقریباً آماده تحویل میگیری. توی JevBench v1.2 هم SemIf با امتیاز 74.6 تقریباً کنار خود Jev با 75.3 قرار گرفته.
اما یه مسیر متفاوت هم شکل گرفته: کلاً LLM مولد رو حذف کن و یه encoder کوچیک رو مخصوص تصمیمگیری آموزش بده. open-jev-deberta-v3-large با DeBERTa همین کار رو کرده و Laya هم با ModernBERT-large + یه decision head اختصاصی جلو رفته.
نکته اینجاست که این مدلها دیگه متن تولید نمیکنن؛ ورودی رو میخونن و مستقیم میگن احتمال هر گزینه چقدره. نتیجه معمولاً مدل خیلی کوچیکتر، latency کمتر و serving ارزونتره. Laya مثلاً فقط 421M پارامتر داره و برای routing، moderation، Support و تصمیمهای پرتکرار طراحی شده.
ولی هزینه این سبک هم مشخصه: LLMهایی مثل SemIf روی سؤالها و دستهبندیهای جدید معمولاً بهتر generalize میکنن، چون پشتشون یه مدل زبانی 4B با دانش عمومی نشسته. encoderهایی مثل Laya و DeBERTa وقتی وارد domain جدید میشن، بیشتر به fine-tuning و داده واقعی همون کسبوکار احتیاج دارن.
برای من دو مسیر کاملاً جدا شده: اگر یه decision engine عمومی میخوای که امروز CRM باشه و فردا Agent Routing و یه روز دیگه چیز جدید، مسیر SemIf منطقیتره. ولی اگر میلیونها تصمیم تکراری و مشخص مثل Support routing، Lead Scoring، Moderation داری، مسیر Laya خیلی جذابتره؛ یه مدل کوچیک که فقط همون کار رو خوب انجام بده، نه یه LLM کامل که برای هر تصمیم کوچیک بیدارش کنیم.
🛠 Join @LLMEngineers Community
Post #515
1.99K
AI Engineers پروژه های Open Source جایگزین Jev کم کم دارن پدیدار میشن 🛠 Join @LLMEngineers Community
- ❤ 9
- 👍 6
- 🔥 2