TGViewer
Tensorflow(@CVision) Tensorflow(@CVision) @cvision · 15.1K subscribers
Post #4033 4K
افزایش وضوح تصویر ورودی برای بهبود عملکرد مدل‌های زبانی دیداری (VLMs)، به‌ویژه در درک تصاویر دارای متن، بسیار مهمه. اما مدل‌های تصویری معروف مثل ViT در وضوح‌ های بالا با مشکل کندی و حجم زیاد داده مواجه هستن.

اپل مدلی به نام FastVLM معرفی کرده که با حفظ دقت، سرعت پردازش رو بالا می‌بره و اندازه مدل رو کوچک‌ تر نگه می‌داره. این مدل از یک رمزگذار تصویری جدید به نام FastViTHD استفاده می‌کنه که برای تصاویر با وضوح بالا، تعداد کمتری توکن تولید و سریع‌ تر عمل می‌کنه.

در آزمایش‌ها، FastVLM سرعت پاسخ‌ دهی اولیه رو بیش از ۳ برابر بهتر کرده و عملکردی مشابه مدل‌ های قوی قبلی داره، در حالی که بسیار سریع‌تر و سبک‌تره، و مستقیما روی iPhone به صورت لوکال قابلیت اجرایی رو داره.

https://www.arxiv.org/abs/2412.13303
  • 👍 20
  • 👌 1
More from @cvision
  1. Sep 20, 2026‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟ ‏Jev‏ بیشتر از اینکه جای GPT‏ یا…
  2. Sep 20, 2026‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد ‏TypeSafe AI روز…
  3. Sep 13, 2026🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف م…
  4. Sep 12, 2026دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار د…
  5. Sep 12, 2026🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟ تصور کن مدلی داشته باشی که ابزار صدا بزنه، مس…
  6. Sep 12, 2026🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟ OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →