توی اکثر بنچمارکهای استخراج داده از سند، مدلها روی اسناد کوتاه زیر ۱۰ صفحه سنجیده میشن و اونجا همهشون نمره بالای ۹۰ میگیرن. اما وقتی همین مدلها رو روی اسناد ۵۰ یا ۱۰۰ صفحهای واقعی میذاری، کاراییشون به شدت افت میکنه.
بنچمارک جدید ExtractBench از لاماایندکس دقیقا روی همین نقطه کور دست گذاشته. اونا ۳۷۰ سند سازمانی واقعی رو در ۴۸۶۹ صفحه ارزیابی کردن و چند تا نتیجه خیلی جالب گرفتن:
اول اینکه توی اسناد بالای ۵۰ صفحه، میزان Recall تمام مدلهای VLM تجاری به زیر ۳۵ درصد سقوط میکنه. یعنی مدل چند صفحه اول رو میخونه و بقیه سند رو کلا رها میکنه.
دوم اینکه قیمت بالاتر لزوماً به معنی دقت بیشتر نیست. توی تستها گرونترین سیستم با ۳۴ سنت برای هر صفحه، دقت کمتری نسبت به سیستمهای ۸ سنتی داشت.
سوم هم اینکه ایجنتهای کدنویسی مثل Claude Code یا Codex هنوز توی درک بصری اسناد اسکنشده، چرخیده یا دستنویس نقاط کور جدی دارند.
اگه توی پروژههاتون با RAG یا ایجنتهای تحلیل سند کار میکنید، حتما این بنچمارک و دیتاسِتش رو بررسی کنید.
لینک بنچمارک و گیتهاب:
http://github.com/run-llama/ExtractBench
@DevTwitter | <Mehdi Allahy
Post #12849
6.61K

- 👍 34
- ❤ 7
- 👎 2