دنیای مدلهای بینایی-زبانی (VLM) در شروع سال ۲۰۲۶ از مرحله "فقط توصیف تصویر" عبور کرده و مستقیماً وارد فاز استدلال بصری و خودکارسازی رابط کاربری (UI Automation) شده است. مدلهایی که اخیراً منتشر شدند، نشان میدهند که تمرکز مهندسی از مدلهای غولآسا به سمت مدلهای بهینه (زیر ۱۰ میلیارد پارامتر) با قابلیت فهم ویدیوهای طولانی و استخراج دقیق متن (OCR) تغییر کرده است.
مدل Qwen3-VL-8B-Instruct که در آخرین روزهای ۲۰۲۵ آپدیت شد، یک نقطه عطف برای ساخت "ایجنتهای بصری" است. استفاده از مکانیزم Interleaved MRoPE به این مدل اجازه میدهد که دادههای متن، تصویر و ویدیو را در کانتکستهای طولانی بدون از دست دادن موقعیتسنجی (Position Encoding) پردازش کند. قابلیت "Time Anchor" در پاسخهای این مدل، یعنی مدل میتواند به ثانیههای دقیق در یک ویدیوی طولانی ارجاع دهد؛ این ویژگی برای مهندسهایی که روی سیستمهای نظارتی یا تحلیل محتوا کار میکنند، یک ابزار کلیدی است. همچنین پشتیبانی از ۳۲ زبان در OCR و بهینهسازی برای تسکهای Visual Agent (مثل کار با محیط GUI)، نشان میدهد که Qwen3-VL فراتر از یک مدل ساده، یک اپراتور بصری است.
استدلال چندوجهی (Multimodal Reasoning) در مدلهای GLM-4.5V و GLM-4.1V Thinking به یک هدف آموزشی درجه اول تبدیل شده است. برخلاف مدلهای قدیمی که فقط پیکسلها را به کلمات تبدیل میکردند، این مدلها یاد گرفتهاند که بر اساس شواهد بصری "فکر" کنند. این یعنی مدل قبل از ارائه جواب، یک زنجیره استدلال داخلی (Chain of Thought) ایجاد میکند تا مطمئن شود خروجی با جزئیات تصویر مطابقت دارد.
مدل GLM-OCR یک رویکرد مهندسی هوشمندانه را برای حل مشکل کندی در پردازش اسناد سنگین پیش گرفته است. این مدل به جای یک پردازش خطی ساده، از پایپلاین "Layout -> Parallel Recognize -> Merge" استفاده میکند. با استفاده از یک انکودر CogViT و یک دیکودر سبک ۰.۵ میلیاردی، این مدل میتواند نواحی مختلف سند را شناسایی کرده، آنها را به صورت موازی بازخوانی کند و در نهایت خروجی Markdown تمیز تحویل دهد. استفاده از Loss اختصاصی MTP (پیشبینی چند توکنی) باعث شده که سرعت و دقت در بازسازی ساختار جداول و متون پیچیده به شدت بالا برود.
مدل LightOnOCR-2-1B نیز با استفاده از تکنیک RLVR (یادگیری تقویتشده با پاداشهای قابل تایید)، استانداردهای جدیدی برای تبدیل تصاویر اسناد به متن تمیز تعریف کرده است. استفاده از RL در OCR به این معناست که مدل بر اساس "درستیِ قابل سنجش" خروجی (مثل مطابقت دقیق با متن اصلی سند) جریمه یا تشویق شده است. این رویکرد باعث کاهش توهم (Hallucination) در بازخوانی اعداد و کلمات خاص در اسناد رسمی و علمی میشود.
به نظر من، ما داریم به پایان دوران سیستمهای OCR سنتی و سنگین (مثل Tesseract) نزدیک میشویم. وقتی مدلهای ۱ تا ۸ میلیاردی میتوانند با دقت انسانی اسناد را بفهمند، ساختار لایوت را حفظ کنند و حتی روی ویدیوها استدلال کنند، یعنی زیرساختهای هوش مصنوعی آماده جایگزینی با فرآیندهای دستی در مقیاس صنعتی هستند. برای مهندسها، الان زمان استفاده از این مدلها در قالب SGLang یا vLLM است تا سیستمهای "سند-فهم" (Document-understanding) واقعی بسازند.
📃 مدل Qwen3-VL در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen3-VL-8B-Instruct
📃 مقاله فنی استدلال چندوجهی GLM:
https://arxiv.org/abs/2507.01006
📃 مخزن GLM-OCR برای پردازش اسناد:
https://github.com/zai-org/GLM-OCR
📃 مدل LightOnOCR-2-1B برای متون چندزبانه:
https://huggingface.co/lightonai/LightOnOCR-2-1B
🛠 Join @LLMEngineers Community
Post #307
1.24K
- ❤ 5