خطکشی برای سنجش کیفیت document understanding
در این پست میخوایم به معرفی benchmark برای تسک document undestanding بپردازیم. این benchmark تسک document undestaning رو تبدیل به سه مساله اصلی کرده:
- تسک اول Document QA است که از روی layout داکیومنت میتونه سوال بپرسه و مدل باید جواب بده. در این حالت سوالها به صورت زبان طبیعی پرسیده میشه اما کانتکست درواقع یه داکیومنته که layout داره (متنی که استایل داره یعنی فونت یا سایزهای متفاوتی داره). مثلا از مدل میپرسند که دو نوع تاریخی که در این داکیومنت وجود داره چه چیزهایی هستند؟ و مدل هم باید مثلا بگه تاریخ فاکتور و تاریخ پرداخت.
- تسک دوم key information extraction است که شبیه تسک اوله با این تفاوت که دیگه query با زبان طبیعی مطرح نمیشه بلکه مدل اطلاعات کلیدی این داکیومنت رو باید بیرون بکشه. مثلا مجموع فاکتور برابر با ۲۰۰۰ دلاره.
- تسک سوم هم Table QA/NLI هست که کار QA و یا NLI رو بر روی جداول انجام میده. این تسک مشخصا بر روی جداول تمرکز داره و سعی میکنه برخی از عبارات رو با استفاده از جدول موجود در داکیومنت verify کنه. مثلا یه جمله ورودی میگیره که آیتم شماره ۱ به مقدار ۲۰۰ قلم فروخته شده و مدل باید بگه که این جمله درسته یا نه. البته میشه از روی جدول، سوال هم پرسید و مدل باید بتونه جواب بده.
یه صفحه هم در نظر گرفته شده که leaderboard است و امتیاز مدلهای مختلف رو گذاشته و حالت overall روی این سه تا تسک داره. اگه در این زمینه کار میکنید خوبه به این بنچمارک توجه کنید و نتایجتون رو با leaderboard مقایسه کنید. در تصویر مثالهای بهتری از هر یک از این سه تسک آورده شده که میتونید مشاهده کنید.
لینک benchmark:
https://duebenchmark.com/leaderboard
لینک github:
https://github.com/due-benchmark
لینک مقاله:
https://datasets-benchmarks-proceedings.neurips.cc/paper/2021/file/069059b7ef840f0c74a814ec9237b6ec-Paper-round2.pdf
#read
#paper
@nlp_stuff
Post #261
2.7K