دوران خوندن HTML تموم شده.
یه تیم تحقیقاتی از دانشگاه UC Berkeley یه مقاله منتشر کرده که میگه برای اینکه AI بتونه صفحات وب رو بهتر بفهمه، به جای اینکه HTML رو بخونه، باید خود صفحه رو مثل یه اسکرینشات ببینه. جالبتر اینکه همین پروژه رو به صورت OSS منتشر کردن.
چیزی که خیلیها توی RAG باهاش مشکل داشتن، یعنی از بین رفتن جدولها، نمودارها و ساختار صفحه موقع تبدیل HTML به متن، ظاهراً از ریشه اشتباه بوده. راهحل اینه که اصلاً صفحه رو تبدیل به HTML و متن نکنیم؛ بذاریم همون چیزی که آدم با چشم میبینه، به AI داده بشه.
استفادهش هم خیلی سادهست؛ نصبش میکنی و فقط URL رو میدی دستش. همین. کل صفحه وب رو برات به شکل اسکرینشات درمیاره.
بعد همین تصویر صفحه مستقیم وارد جستجوی برداری (Vector Search) میشه. یعنی جدول، نمودار، فرمول و هر چیزی که روی صفحه هست، همون شکلی که انسان میبینه به مدل میرسه.
نتیجه؟ نسبت به RAG معمولی مبتنی بر متن، تا ۱۸.۱٪ دقت بهتر گزارش شده.
حتی ایندکس ۸.۲۸ میلیون صفحه ویکیپدیا هم آمادهست و بدون نیاز به API Key میتونی ازش استفاده کنی.
چندتا نکته جالب:
با نصب پلاگینش برای Claude، کلود دیگه فقط وب رو نمیخونه، بلکه واقعاً صفحه رو میبینه.
چون ایندکس بر اساس پیکسل ذخیره میشه، وقتی مدلهای جدید میاد لازم نیست دوباره کل دیتاست رو بسازی.
به نظر میاد داریم از دورهی AI که وب رو میخونه وارد دورهی AI که وب رو میبینه میشیم.
ارزش داره ذخیرهش کنی و بعدا یه تست بزنی :
pixelrag.ai@Linuxor