یه پروژه جالب به اسم Valen اومده که بهجای اینکه مدل بعد از دیدن تصویر بشینه reasoning طولانی تولید کنه، مستقیماً از روی تصویر/متن، احتمال action های مختلف رو حساب میکنه؛ یعنی ورودی میره داخل مدل و خروجی میشه تصمیم آماده برای اجرا.
روی Qwen3.5-2B ساخته شده و یه Decision Head به مدل اضافه میکنه. مثلاً برای یه بازی میتونه خروجیای شبیه Left: 0.05 / Right: 0.72 / Up: 0.18 / Down: 0.05 بده و Agent هم سریعترین action رو انتخاب کنه. این معماری برای بازیها، UI Agentها، moderation و سیستمهای real-time خیلی جالبه.
توی benchmark مربوط به Sokoban، Valen با 9 تصمیم مجموعاً حدود 1.13 ثانیه latency داشته، درحالیکه Qwen3.8-27B Think برای همون سناریو حدود 198.05 ثانیه زمان گرفته. نکته مهم اینه که این اعداد مربوط به همین task و setup هستن، نه اینکه 2B در همهچیز جای 27B رو بگیره.
تست آنلاین :
huggingface.co/spaces/yuhangzang/Valen-Preview-0923
سورس کد :
github.com/Liuziyu77/Valen
@Linuxor
Post #5436
7.38K