TGViewer
DevTwitter | توییت برنامه نویسی DevTwitter | توییت برنامه نویسی @devtwitter · 32.3K subscribers
Post #12849 6.61K
توی اکثر بنچمارک‌های استخراج داده از سند، مدل‌ها روی اسناد کوتاه زیر ۱۰ صفحه سنجیده میشن و اونجا همه‌شون نمره بالای ۹۰ میگیرن. اما وقتی همین مدل‌ها رو روی اسناد ۵۰ یا ۱۰۰ صفحه‌ای واقعی میذاری، کارایی‌شون به شدت افت میکنه.

بنچمارک جدید ExtractBench از لاماایندکس دقیقا روی همین نقطه کور دست گذاشته. اونا ۳۷۰ سند سازمانی واقعی رو در ۴۸۶۹ صفحه ارزیابی کردن و چند تا نتیجه خیلی جالب گرفتن:

اول اینکه توی اسناد بالای ۵۰ صفحه، میزان Recall تمام مدل‌های VLM تجاری به زیر ۳۵ درصد سقوط میکنه. یعنی مدل چند صفحه اول رو میخونه و بقیه سند رو کلا رها میکنه.

دوم اینکه قیمت بالاتر لزوماً به معنی دقت بیشتر نیست. توی تست‌ها گرون‌ترین سیستم با ۳۴ سنت برای هر صفحه، دقت کمتری نسبت به سیستم‌های ۸ سنتی داشت.

سوم هم اینکه ایجنت‌های کدنویسی مثل Claude Code یا Codex هنوز توی درک بصری اسناد اسکن‌شده، چرخیده یا دست‌نویس نقاط کور جدی دارند.

اگه توی پروژه‌هاتون با RAG یا ایجنت‌های تحلیل سند کار می‌کنید، حتما این بنچمارک و دیتاسِتش رو بررسی کنید.
لینک بنچمارک و گیت‌هاب:
http://github.com/run-llama/ExtractBench

@DevTwitter | <Mehdi Allahy
  • 👍 34
  • ❤ 7
  • 👎 2
More from @devtwitter
  1. Sep 30, 2026🔎 #وبینار عملی ریشه‌یابی خطا با Sentry 🔮 در وبینار «از گزارش خطای کاربر تا ریشه‌یابی مشک…
  2. Sep 30, 2026دوره‌ی Stanford درباره‌ی Transformers و LLMها در فصل جدید شروع شده دوره CME 295 از پایه‌ی…
  3. Sep 30, 2026تست‌های سنتی E2E شکننده‌اند؛ یک تغییر جزیی در CSS یا تایمینگ انیمیشن، کل CI/CD pipeline را…
  4. Sep 30, 2026این رایگانه و خیلی سرویس خفنیه. ایده اینه که آدرس هر سایتی که خواستی رو بهش بدی و این سروی…
  5. Sep 30, 2026شرکت امنیتی Group-IB یک بدافزار جاسوسی مبتنی بر تلگرام با نام HEAVYGRAM و یک ابزار مبتنی ب…
  6. Sep 30, 2026خیلی ناگهانی برای یه مسئله‌ای نیاز پیدا کردم که یه بروزر داشته باشم که هر وقت یه session ا…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →