TGViewer
Linuxor ? Linuxor ? @linuxor · 31.9K subscribers
Post #5560 4.25K
یه مدل System One مثل Jev ممکنه اصلاً به تمام عمق یه LLM نیاز نداشته باشه. پژوهشگرهای AutoScientists متوجه شدن که میشه بخش قابل‌توجهی از لایه‌های انتهایی شبکه رو بدون اینکه عملکرد مدل در تصمیم‌گیری افت کنه، حذف کرد.

مثلاً توی مدل Qwen3.5-4B وقتی پردازش رو توی لایه 20 از مجموع 32 لایه متوقف کردن، عملکرد تقریباً با حالتی که کل مدل استفاده می‌شد یکسان بود. پس 12 لایه آخر رو حذف کردن و مدل RSI-Jev v5.0-VL 3B رو ساختن.

این مدل توی معیار Decision Index امتیاز 38.38 گرفته، در حالی که بهترین مدل بعدی با اندازه 3B یا کمتر امتیاز 28.97 داشته. این مدل حتی از 11 مدل 4B هم عملکرد بهتری داشته.

وقتی از این زاویه نگاه کنیم، قضیه تا حدی منطقی به نظر میاد: تصمیم‌گیری و صحبت کردن 2 کار متفاوتن یه مدل System One لازم نیست کلمه بعدی رو تولید کنه؛ فقط باید اطلاعات رو بخونه و یه تصمیم بگیره.

سوال بعدی، چرا باید همه سوال‌ها رو با عمق یکسانی پردازش کنیم؟ اگه سوال‌های ساده بتونن زودتر متوقف بشن و سوال‌های سخت‌تر برن سراغ لایه‌های عمیق‌تر، این روش می‌تونه سرعت مدل رو خیلی بیشتر کنه:

github.com/Shanghua-Gao/RSI-Jev

@Linuxor
More from @linuxor
  1. Oct 3, 2026از این به بعدی برای خرید دامنه ir. باید از خودتون فیلم بگیرید! @Linuxor
  2. Oct 3, 2026این ویدیو رو ببینید با هوش مصنوعی Opus 5.5 ساخته شده هوش مصنوعی به هر حوزه ای ضربه بزنه به…
  3. Oct 3, 2026یکی از دوستان یه ربات ساخته که هرچیزی بخواید با قیمت پایین توش موجوده از شماره مجازی همه س…
  4. Oct 3, 2026وقتی یه مدل رایگان لوکال پیدا کردی و پروژه رو باهاش می‌بری جلو... @Linuxor
  5. Oct 3, 2026سم آلتمن می‌گه من واقعاً از این موضوع معذبم که بعضی‌ها می‌خوان برای مدل‌های هوش مصنوعی نوع…
  6. Oct 3, 2026غول فناوری و هوش مصنوعی یک سرور قدرتمند برای نسل جدید پردازش‌های هوش مصنوعی و زیرساخت‌های…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →