TGViewer
Tensorflow(@CVision) Tensorflow(@CVision) @cvision · 15.1K subscribers
Post #4394 3.25K
‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟

‏Jev‏ بیشتر از اینکه جای GPT‏ یا Claude‏ را بگیرد، می‌تواند یک «لایه‌ی تصمیم‌گیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بی‌خودی برای هرکدام یک مدل بزرگ صدا می‌زنیم.

‏تقسیم کار پیشنهادی (Separation of Concerns‏):

‏• تصمیم‌های کوچک و پرتعداد ← Jev
‏• تحلیل، reasoning‏ و تولید محتوا ← GPT / Claude / Gemini‏
‏• قوانین قطعی، محاسبات و محدودیت‌های حساس ← Code‏
‏• تصمیم‌های پرریسک ← انسان

‏نمونه کاربردها:

‏• CRM‏: دسته‌بندی مشتری‌ها بر اساس احتمال ریزش، اهمیت یا نوع درخواست
‏• Support‏ و Lead Scoring‏: تشخیص فوریت، تیم مناسب و ارزش سرنخ‌ها
‏• Agent Routing‏: انتخاب agent‏، tool‏ یا مدل مناسب قبل از شروع کار سنگین
‏• RAG‏: حذف اسناد کم‌ربط و re-rank‏ نتایج
‏• QA‏ و Moderation‏: بررسی کیفیت، ارتباط و ریسک خروجی مدل‌ها، و پرچم‌گذاری محتوای مشکوک
‏• Workflow Automation‏: تعیین شاخه‌ی فرایند برای هر درخواست
‏• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه

‏⚠️ اما Jev‏ «خیلی باهوش‌تر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئله‌های مبهم افت می‌کند. دو نمونه:

‏1️⃣ Browser automation‏
‏تیم WebMCP‏ (Idan Levin‏) با ترکیب Jev‏ و WebMCP‏ همه‌ی 49 task‏ را حل کرد. ولی این ترکیب دو مدل بود: Jev‏ ابزار را انتخاب می‌کرد و یک LLM‏ سریع (Mercury 2.5‏) آرگومان‌ها را می‌نوشت، چون Jev‏ متن تولید نمی‌کند. وقتی Jev‏ مستقیم با کنترل‌های صفحه مرورگر را می‌راند، فقط 25 از 49 task‏ حل شد. خود نویسندگان می‌گویند این نتیجه‌ی harness‏ آن‌هاست و سقف عمومی Jev‏ نیست.

‏2️⃣ تشخیص phishing‏
‏در یک benchmark‏ مستقل روی 2000 ایمیل (ایمیل‌های synthetic‏)، دقت مستقیم Jev‏ فقط 62.6٪ بود و Claude Haiku 4.5‏ به 81.3٪ رسید.
‏ولی وقتی همان مسئله به 5 سؤال ساده‌تر شکسته شد (مثلاً: لینک به free hosting‏ اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جواب‌های Jev‏ به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنال‌ها 89.5٪ می‌داد.

‏در همین تست Jev‏ حدود 3 برابر سریع‌تر (239ms‏ در برابر 687ms‏) و حدود 12 برابر ارزان‌تر ($0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku‏ بود. یعنی در مقایسه با یک مدل سبک، ضریب‌ها خیلی کمتر از «40x‏ تا 200x‏» است.

‏پس جای درست Jev‏ «مغز کل سیستم» نیست، بلکه یک قطعه‌ی سریع برای تصمیم‌های محدود داخل یک معماری بزرگ‌تر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهم‌تر، چندمرحله‌ای‌تر یا پرریسک‌تر شود، بهتر است به یک مدل قوی‌تر یا انسان سپرده شود.

‏منابع:
‏https://madewithjev.com/builds/webmcp-benchmark
‏https://github.com/anisselbd/jev-phishing-bench
Madewithjev Jev on the WebMCP benchmark — built with Jev Jev picks the tool, a fast LLM fills the arguments: 49 of 49 tasks solved.
  • ❤ 16
  • 👏 5
More from @cvision
  1. Sep 28, 2026مهلت استفاده تا پایان این هفته است
  2. Sep 20, 2026‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد ‏TypeSafe AI روز…
  3. Sep 13, 2026🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف م…
  4. Sep 12, 2026دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار د…
  5. Sep 12, 2026🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟ تصور کن مدلی داشته باشی که ابزار صدا بزنه، مس…
  6. Sep 12, 2026🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟ OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →