افزایش وضوح تصویر ورودی برای بهبود عملکرد مدلهای زبانی دیداری (VLMs)، بهویژه در درک تصاویر دارای متن، بسیار مهمه. اما مدلهای تصویری معروف مثل ViT در وضوح های بالا با مشکل کندی و حجم زیاد داده مواجه هستن.
اپل مدلی به نام FastVLM معرفی کرده که با حفظ دقت، سرعت پردازش رو بالا میبره و اندازه مدل رو کوچک تر نگه میداره. این مدل از یک رمزگذار تصویری جدید به نام FastViTHD استفاده میکنه که برای تصاویر با وضوح بالا، تعداد کمتری توکن تولید و سریع تر عمل میکنه.
در آزمایشها، FastVLM سرعت پاسخ دهی اولیه رو بیش از ۳ برابر بهتر کرده و عملکردی مشابه مدل های قوی قبلی داره، در حالی که بسیار سریعتر و سبکتره، و مستقیما روی iPhone به صورت لوکال قابلیت اجرایی رو داره.
https://www.arxiv.org/abs/2412.13303
Post #4033
4K

- 👍 20
- 👌 1