TGViewer
The Layer The Layer @layercv · 852 subscribers
Post #69 766
Аж 4 дня, как вышла LMM LLaVA-1.6, а времени написать о ней всё не было. А есть о чём.

Самое главное и долгожданное мной изменение, это то, что авторы называют Dynamic High Resolution – способ работы с изображениями произвольного размера на вход. Дело в том, что оригинальной работе и в версии 1.5 использовалось фиксированное разрешение (224х224 и 336х336), но это было не от хорошей жизни. Тоже самое и в большинстве альтернативных подходов.
При этом, с самого начала не скрывалось использование динамического метода в ChatGPT-V, что понятно хотя бы даже из пояснений к прайсингу. Преимущества для работы с деталями, небольшими объектами и текстом очевидны, и поэтому вопрос перехода к чему-то подобному был делом времени.

В общем, вот как авторы LLaVA это решают: они берут CLIP-ViT-L-14 и разбивают в соответствии с заданными схемами изображение на кусочки по 224х224 (что интересно, у ChatGPT разбивается на 512x512), которые процессят независимо энкодером. Параллельно, по-старинке, процессят и изображение целиком. Последнее нужно для передачи глобального контекста, а так же, чтобы компенсировать артефакты первого. В аппендиксе статьи показано на метриках, что это играет существенную роль.
Затем всё вместе загоняют в LLM.
Поскольку сетки разбиения предопределены, максимальное разрешение ограничено размерами 672x448 или 448x672.

Есть, также, ряд других улучшений и, по итогу, LLaVA-1.6 в версии 34B перформит соизмеримо с коммерческими моделями: умудрилась на нескольких бенчмарках даже обойти ChatGPT-V, на большей части Gemini Pro (предпоследняя по мощности модель от Google) и на всех представленных Qwen-VL-Plus (от Alibaba). Детальнее можно посмотреть на сайте или в обновлённой статье LLaVa-1.5.
Результаты для открытой сети с доступным трейн кодом совершенно ошеломительные и круто задрайвят развитие области.
Демка тут.
  • 👍 6
  • 🔥 5
  • 👏 1
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →