امروز داشتم گزارش فنی جدید Baidu رو ورق میزدم که کلاً دیدم رو نسبت به هندل کردن داکیومنتهای طولانی عوض کرد. اسمش رو گذاشتن Unlimited OCR و برخلاف مدلهای فعلی که برای پردازش چند صفحه پشتسرهم لنگ میزنن، این یکی خیلی خوب عمل میکنه.
مشکل چیه؟ مدلهای خفن مثل DeepSeek OCR از LLM برای دیکود کردن استفاده میکنن. هر چی متن طولانیتر بشه، KV Cache بزرگتر میشه، رم رو میبلعه و سرعت تولید توکن (TPS) میاد پایین. به خاطر همین همیشه مجبوریم داکیومنت رو صفحه به صفحه بدیم به مدل که باعث میشه زمینه (Context) از دست بره.
بایدو اومده یه حرکت هوشمندانه زده و Reference Sliding Window Attention یا همون R-SWA رو معرفی کرده. ایدهاش اینه: هر توکنی که داره تولید میشه، به «تمام» توکنهای تصویری (Reference Tokens) دسترسی داره ولی فقط به «یه پنجره محدود» (مثلاً ۱۲۸ تا) از توکنهای متنی قبلی نگاه میکنه. دقیقاً مثل وقتی که داریم از روی یک کتاب مشق مینویسیم؛ کل صفحه جلو چشممونه ولی فقط چند کلمه آخری که نوشتیم رو تو ذهنمون نگه میداریم که یادمون نره کجاییم.
توی این معماری، برخلاف MHA معمولی که مصرف حافظهاش خطی بالا میره، اینجا KV Cache کاملاً ثابته. یعنی چه صفحه اول باشی چه صفحه چهلم، سرعت و مصرف گرافیک فرقی نمیکنه. با همون Context Window معمول ۳۲ هزارتایی، تونستن دهها صفحه رو توی یک Forward Pass پردازش کنن که برای پروژههای آرشیو و پردازش کتاب یه نعمته.
به نظر من جذابترین بخشش اینه که دقتش نه تنها کم نشده، بلکه توی بنچمارک OmniDocBench از خودِ DeepSeek هم جلو زده (حدود ۹۳ درصد). این نشون میده که برای کارهای Parsing، لازم نیست مدل تمام تاریخچه متنی رو یادش باشه؛ فقط کافیه تصویر رو درست ببینه و ترتیب رو گم نکنه.
حتمالاً به زودی این تکنیک رو توی ASR و ترجمه هم میبینیم چون اونجا هم وابستگی به مرجع (Reference) ثابته ولی خروجی هی طولانیتر میشه.
🛠 Join @LLMEngineers Community
Post #359
1.49K
- ❤ 15
- 👍 6