❔ Почему Vision-Language Models пока не заменили Computer Vision
Каждый раз, когда выходит новая Vision-Language Model, появляются одни и те же заявления:
👎 «YOLO умер.»
👎 «Классический Computer Vision больше не нужен.»
👎 «Одна VLM заменит весь vision pipeline.»
За несколько лет работы над production-системами Computer Vision я пришёл к другому выводу.
👍 VLM действительно великолепны, когда задача открытая.
Нужно объяснить, почему ситуация выглядит опасной? Описать необычное поведение? Ответить на произвольный вопрос по изображению?
Здесь VLM часто являются лучшим инструментом.
Но большинство production-систем решают совсем другие задачи.
➡️ Они обнаруживают людей.
➡️ Отслеживают объекты.
➡️ Считают посетителей.
➡️ Находят телефоны.
➡️ Определяют открытый кассовый ящик.
И всё это происходит миллионы раз каждый день.
Именно здесь специализированные vision-модели по-прежнему выигрывают.
💨 Они работают быстрее.
💸 Их значительно дешевле запускать.
😳 Их результаты детерминированы и легко интегрируются в бизнес-логику.
📦 Они эффективно работают на edge-устройствах: NVIDIA Jetson, промышленных компьютерах и других ограниченных по ресурсам платформах.
При этом VLM сильны совсем в другом. Они понимают контекст.
Поэтому, на мой взгляд, они не заменяют детекторы, трекеры, OCR или модели сегментации, а становятся ещё одним уровнем системы.
Самая эффективная архитектура, которую я вижу сегодня, выглядит гибридной.
Специализированные модели выполняют миллионы быстрых и дешёвых операций.
VLM подключается только тогда, когда действительно требуется понимание происходящего или более глубокий анализ сцены.
Поэтому настоящий вопрос сегодня звучит не так:
❌ «Что лучше: YOLO или VLM?»
А так:
✔️ «Какие задачи должны выполнять специализированные vision-модели, а какие лучше передать VLM?»
Думаю, именно ответ на этот вопрос, а не очередной рекорд в бенчмарках, будет определять архитектуру production-систем Computer Vision в ближайшие годы.
LinkedIn: https://www.linkedin.com/in/nikitakluchikov/
Post #240
188
- 👍 3