یه پروژه جالب به اسم Jev Ultrafast که توسط Browser Use منتشر شده که هدفش ساختن Browser Agentهای سریعتر و کمهزینهتره. ایدهش اینه که برای هر حرکت، مدل مجبور نباشه screenshot صفحه رو ببینه و کل UI رو دوباره تحلیل کنه. Jev بهجای screenshot، ساختار صفحه و المنتهای قابل تعامل رو به شکل ساده و شمارهگذاریشده در اختیار مدل میذاره؛ مثلاً [3] textbox یا [7] button. مدل فقط تصمیم میگیره روی کدوم المنت چه کاری انجام بشه. یعنی بهجای اینکه LLM مستقیماً browser رو کنترل کنه، بیشتر شبیه یه decision maker عمل میکنه:
hgithub.com/browser-use/jev-ultrafast
@Linuxor
Post #5380
8.19K