TGViewer
AI Engineers AI Engineers @llmengineers · 2.62K subscribers
Post #307 1.24K
دنیای مدل‌های بینایی-زبانی (VLM) در شروع سال ۲۰۲۶ از مرحله "فقط توصیف تصویر" عبور کرده و مستقیماً وارد فاز استدلال بصری و خودکارسازی رابط کاربری (UI Automation) شده است. مدل‌هایی که اخیراً منتشر شدند، نشان می‌دهند که تمرکز مهندسی از مدل‌های غول‌آسا به سمت مدل‌های بهینه (زیر ۱۰ میلیارد پارامتر) با قابلیت فهم ویدیوهای طولانی و استخراج دقیق متن (OCR) تغییر کرده است.

مدل Qwen3-VL-8B-Instruct که در آخرین روزهای ۲۰۲۵ آپدیت شد، یک نقطه عطف برای ساخت "ایجنت‌های بصری" است. استفاده از مکانیزم Interleaved MRoPE به این مدل اجازه می‌دهد که داده‌های متن، تصویر و ویدیو را در کانتکست‌های طولانی بدون از دست دادن موقعیت‌سنجی (Position Encoding) پردازش کند. قابلیت "Time Anchor" در پاسخ‌های این مدل، یعنی مدل می‌تواند به ثانیه‌های دقیق در یک ویدیوی طولانی ارجاع دهد؛ این ویژگی برای مهندس‌هایی که روی سیستم‌های نظارتی یا تحلیل محتوا کار می‌کنند، یک ابزار کلیدی است. همچنین پشتیبانی از ۳۲ زبان در OCR و بهینه‌سازی برای تسک‌های Visual Agent (مثل کار با محیط GUI)، نشان می‌دهد که Qwen3-VL فراتر از یک مدل ساده، یک اپراتور بصری است.

استدلال چندوجهی (Multimodal Reasoning) در مدل‌های GLM-4.5V و GLM-4.1V Thinking به یک هدف آموزشی درجه اول تبدیل شده است. برخلاف مدل‌های قدیمی که فقط پیکسل‌ها را به کلمات تبدیل می‌کردند، این مدل‌ها یاد گرفته‌اند که بر اساس شواهد بصری "فکر" کنند. این یعنی مدل قبل از ارائه جواب، یک زنجیره استدلال داخلی (Chain of Thought) ایجاد می‌کند تا مطمئن شود خروجی با جزئیات تصویر مطابقت دارد.

مدل GLM-OCR یک رویکرد مهندسی هوشمندانه را برای حل مشکل کندی در پردازش اسناد سنگین پیش گرفته است. این مدل به جای یک پردازش خطی ساده، از پایپ‌لاین "Layout -> Parallel Recognize -> Merge" استفاده می‌کند. با استفاده از یک انکودر CogViT و یک دیکودر سبک ۰.۵ میلیاردی، این مدل می‌تواند نواحی مختلف سند را شناسایی کرده، آن‌ها را به صورت موازی بازخوانی کند و در نهایت خروجی Markdown تمیز تحویل دهد. استفاده از Loss اختصاصی MTP (پیش‌بینی چند توکنی) باعث شده که سرعت و دقت در بازسازی ساختار جداول و متون پیچیده به شدت بالا برود.

مدل LightOnOCR-2-1B نیز با استفاده از تکنیک RLVR (یادگیری تقویت‌شده با پاداش‌های قابل تایید)، استانداردهای جدیدی برای تبدیل تصاویر اسناد به متن تمیز تعریف کرده است. استفاده از RL در OCR به این معناست که مدل بر اساس "درستیِ قابل سنجش" خروجی (مثل مطابقت دقیق با متن اصلی سند) جریمه یا تشویق شده است. این رویکرد باعث کاهش توهم (Hallucination) در بازخوانی اعداد و کلمات خاص در اسناد رسمی و علمی می‌شود.

به نظر من، ما داریم به پایان دوران سیستم‌های OCR سنتی و سنگین (مثل Tesseract) نزدیک می‌شویم. وقتی مدل‌های ۱ تا ۸ میلیاردی می‌توانند با دقت انسانی اسناد را بفهمند، ساختار لایوت را حفظ کنند و حتی روی ویدیوها استدلال کنند، یعنی زیرساخت‌های هوش مصنوعی آماده جایگزینی با فرآیندهای دستی در مقیاس صنعتی هستند. برای مهندس‌ها، الان زمان استفاده از این مدل‌ها در قالب SGLang یا vLLM است تا سیستم‌های "سند‌-فهم" (Document-understanding) واقعی بسازند.

📃 مدل Qwen3-VL در هاگینگ فیس:
https://huggingface.co/Qwen/Qwen3-VL-8B-Instruct

📃 مقاله فنی استدلال چندوجهی GLM:
https://arxiv.org/abs/2507.01006

📃 مخزن GLM-OCR برای پردازش اسناد:
https://github.com/zai-org/GLM-OCR

📃 مدل LightOnOCR-2-1B برای متون چندزبانه:
https://huggingface.co/lightonai/LightOnOCR-2-1B

🛠 Join @LLMEngineers Community
  • ❤ 5
More from @llmengineers
  1. Oct 8, 2026از نظر کاربرد Decision Modelها , قضیه دیگه فقط چند Demo نیست و چند الگوی مشخص واقعاً وارد…
  2. Oct 8, 2026کمتر از یک ماه از معرفی Jev گذشته و چیزی که اول شبیه یه مدل خاص برای «تصمیم‌گیری بدون تولی…
  3. Oct 7, 2026جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دن…
  4. Oct 7, 2026photo post
  5. Oct 7, 2026چند روز اخیر پر از خبر AI بود، ولی وقتی تکراری‌ها، لیک‌ها و تغییرات کم‌اهمیت رو کنار بذاری…
  6. Sep 30, 2026جمنای ۴ معرفی شد !
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →