TGViewer
The Layer The Layer @layercv · 852 subscribers
Post #62 861
Наш паблик, по задумке, рассчитан на самую разную аудиторию: от просто сопереживающих до опытных специалистов. Чтобы эту дисперсию сгладить, иногда мы будем писать быстрые гайды для погружения в тему.

Сегодня поговорим о том, понимание чего читателю пригодится в наших будущих постах (🤫) - больших мультимодальных моделях (LMM).
Говорить будем в разрезе задачи визуального ассистента: т.е., в простейшем случае речь идёт об изображение + текст на входе -> текст на выходе.

Любой, у кого есть подписка на платную версию ChatGPT, в общем-то хорошо понимает, о чём речь.
А что происходит в опенсорсе?

17 апреля 2023 года, ещё до релиза превью мультимодальной ChatGPT-4V, вышла работа LLaVA (Large Language and Vision Assistant). В среде специалистов она наделала много шума, поскольку всё гениально - просто, и авторы, не сделав ничего недоступного другим, сумели достичь блестящих результатов.

Маленькое отступление: краеугольным камнем всех моделей-ассистентов являются инструктивные данные. В нашем случае они выглядят как картинка + инструкция. Например, можно подать изображение с тем, как человек меняет колесо автомобиля на обочине дороги на вход и попросить сеть описать, какую проблему человек решает, почему она возникла и пр. Такие данные мощно драйвят модель к глубокому пониманию сути вещей.

Так вот, в LLaVA, авторы решили собирать такие инструктивные данные для обучения через ChatGPT, поскольку это мощная модель, способная создавать и сами инструкции, и ответы к ним. А ещё потому что люди такие описания делают достаточно плохо.
Но, поскольку картинки ChatGPT съесть ещё не была способна, они хитрым образом извернулись и подавали подробные текстовые описания изображений, включающие даже баундинг боксы объектов.
Дальше всё достаточно просто: собрав качественные инструктивные данные, авторы взяли LLM Vicuna и ViT-L/14 энкодер из CLIP, и собрали всё это вместе. Таким образом, на вход LLM подаётся текст + эмбеддинги изображения. А чтобы эти визуальные эмбеддинги перевести в текстовое гиперпространство, авторы докинули простой линейный слой. Т.е., тренировка состоит из двух этапов: сначала всё, кроме проекционного слоя замораживается и обучается он, затем размораживается ещё и LLM, чтобы обучить ассистента. Визуальный энкодер остаётся в снегу на всех этапах.

Можете посмотреть демо самостоятельно. Итоговая модель оказалась весьма хороша, особенно с учётом того, как данные собирались, что их было немного и относительной простоты всей системы.
Короче, подход взлетел.

Затем была LLaVA 1.5 с небольшими улучшениями и исправлениями (например, заменили линейный слой на MLP - Multi layer perceptron, ну и много другого поправили), а в конце ноября вышла ShareGPT4V.

Авторы первыми дерзко-резко подорвались и исправили главную проблему LLaVA: они набрали данные из ChatGPT-4V, т.е. с уже нормальной мультимодальностью, а не текстовым описанием изображения. Самой большой и нераскрытой интригой статьи остаётся то, как они обошли ограничение в 100 запросов в день, которое на тот момент действовало для всех :)

Но, как бы то ни было, причесав данные и особо даже ничего больше и не меняя, ребята мощно стрельнули: сеть на данный момент или лучшая из открытых, или одна из лучших, смотря на чём смотреть.
Вот тут можно поиграть с демо (ему изредка плохеет и оно ложится).

Ну и там уже гору всяких вариаций понаделали: LLaVAR (улучшение для OCR задач), LLaVA-Grounding (детекция и сегментация), LLaVA-Interactive (для визуального взаимодействия), LLaVA-Plus (для всего на свете), Video-LLaVA и даже LLaVA-Med.
  • 🔥 18
  • 👍 1
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →