TGViewer
The Layer The Layer @layercv · 853 subscribers
Post #79 662
Если вы активный пользователь больших визуальных (мультимодальных) моделей, таких как Google Gemini или ChatGPT-4V 🗯, которые принимают на вход не только текст, но и изображение, то вероятно, что вы уже привыкли решать через них множество разных задач.
Используют их в хвост и гриву не только целевые пользователи, но и исследователи: через LVM (они же в нашем контексте MLLM, LMM) чего только не вытворяют: от сегментации объектов до редактирования изображений.

Несмотря на то, что стоимость \ время инференса этих моделей может превышать стоимость специализированных решений в тысячи раз, всё равно это выглядит привлекательно.

Судите сами:
Вместо того, чтобы каждый раз собирать тонну данных, чистить их, исследовать задачу, заниматься бесконечной инженерной работой, не говоря о том, что нужно обладать некоторыми знаниями и опытом, достаточно просто правильно подобрать промт и развернуть модель \ заплатить за API.
Множество стартапов так и живут.

Работает всё иной раз так хорошо, что кажется, что через них можно решить буквально что угодно. С точки зрения науки, тем не менее, не совсем понятно, действительно это уже так или пока ещё вопрос ближайшего будущего. В каких-то задачах данные есть и они говорят, что да, в других задачах выходит, что нет, в большинстве ничего не понятно.

В процессе разработки второй версии MiVOLO мы об этом много думали и экспериментировали. Было интересно, на что уже способны лучшие из MLLM, что можно выжать из них для нашей задачи в максимуме и есть ли вообще ещё смысл в спец. моделях? Ответов накопилось на статью😁 Вчера выпустили препринт:

📖 https://arxiv.org/abs/2403.02302
  • 🔥 8
  • ❤ 4
  • 👏 1
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →