TGViewer
CV Time CV Time @timeforcv · 3.47K subscribers
Post #5 1.46K
PaliGemma — открытая и производительная VLM

Сегодняшняя статья о PaliGemma. Это VLM, которая разработана на основе технологий семейства моделей PaLI и Gemma. На вход PaliGemma может получать изображения или видео как последовательность кадров.

Модель обучается в четыре этапа:

Unimodal pretraining — на этом этапе PaLI и Gemma обучаются отдельно на данных одного типа.

Multimodal pretraining — здесь вся модель обучается на большом — миллиард сэмплов — наборе мультимодальных задач, таких как объединение визуальных и текстовых данных. Здесь важно, что ни одна часть модели не остаётся «замороженной» — все её компоненты обучаются вместе.

Resolution increase — происходит дополнительное обучение на данных с более высоким разрешением изображений (448 и 896 пикселей).

Трансфер на целевые задачи вроде описания изображений для COCO, VQA для дистанционного зондирования и другие специализированные цели. Этот этап также предполагает дообучение на новых данных, чтобы модель могла решать задачи, для которых она ранее не обучалась.

Важная особенность PaiGemma — использование подхода prefix-LM. Ко всей входной последовательности — изображениям и префиксам — здесь применяется фулл (двунаправленный) аттеншн. Это сделано для того, чтобы большее количество токенов могло активно участвовать в процессе «мышления» с самого начала, так как токены изображения могут обращаться к токенам префикса, которые представляют собой запрос.

Для суффиксов используют кэжуал аттеншн для в авторегресионной генерации. Это позволяет генерировать ответы последовательно, предсказывая следующий токен на основе предыдущих.

В задаче генерации описаний для изображений на датасете COCO PaliGemma выдала результат 141,9 балла при разрешении 224 пикселей и улучшила показатели до 144,6 на 448. В задаче визуальных вопросов и ответов VQAv2 модель продемонстрировала результат в 83,2 и 85,6 балла для разрешения в 224 и 448 пикселей соответственно.

Разбор подготовил ❣ Александр Шишеня
CV Time
  • 🔥 9
  • 👍 5
  • ❤ 4
More from @timeforcv
  1. Sep 29, 2026Четыре способа испортить предсказание диффузионной модели Сегодня делимся обзором четырёх…
  2. Sep 25, 2026Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation Разбираем стат…
  3. Sep 16, 2026When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virt…
  4. Sep 14, 2026Trustworthy Image Authentication using Forensic Knowledge Graphs На ECCV 2026 прослеживали…
  5. Sep 11, 2026Мы всё ещё на ECCV: репортаж с воркшопа о квантовых вычислениях в компьютерном зрении Наш…
  6. Sep 10, 2026Больше CV на ECCV! Наши инженеры поделились ещё двумя интересными работами на тему компьют…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →