یه مدل System One مثل Jev ممکنه اصلاً به تمام عمق یه LLM نیاز نداشته باشه. پژوهشگرهای AutoScientists متوجه شدن که میشه بخش قابلتوجهی از لایههای انتهایی شبکه رو بدون اینکه عملکرد مدل در تصمیمگیری افت کنه، حذف کرد.
مثلاً توی مدل Qwen3.5-4B وقتی پردازش رو توی لایه 20 از مجموع 32 لایه متوقف کردن، عملکرد تقریباً با حالتی که کل مدل استفاده میشد یکسان بود. پس 12 لایه آخر رو حذف کردن و مدل RSI-Jev v5.0-VL 3B رو ساختن.
این مدل توی معیار Decision Index امتیاز 38.38 گرفته، در حالی که بهترین مدل بعدی با اندازه 3B یا کمتر امتیاز 28.97 داشته. این مدل حتی از 11 مدل 4B هم عملکرد بهتری داشته.
وقتی از این زاویه نگاه کنیم، قضیه تا حدی منطقی به نظر میاد: تصمیمگیری و صحبت کردن 2 کار متفاوتن یه مدل System One لازم نیست کلمه بعدی رو تولید کنه؛ فقط باید اطلاعات رو بخونه و یه تصمیم بگیره.
سوال بعدی، چرا باید همه سوالها رو با عمق یکسانی پردازش کنیم؟ اگه سوالهای ساده بتونن زودتر متوقف بشن و سوالهای سختتر برن سراغ لایههای عمیقتر، این روش میتونه سرعت مدل رو خیلی بیشتر کنه:
github.com/Shanghua-Gao/RSI-Jev
@Linuxor
Post #5560
4.25K