LLaVA-OneVision-2-8B: мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров
Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео. Вместо того чтобы нарезать видео на равномерные кадры, модель анализирует сжатый видеопоток через кодек.
Большинство моделей просто нарезают видео на 8–32 равномерных кадра и выбрасывают остальное. Если что-то важное происходит между двумя отобранными кадрами, модель это просто пропустит. Видеокодеки вроде H.264 уже содержат информацию о том, где в видео происходят изменения, LLaVA-OV-2 использует именно её. Модель отбирает фрагменты с высоким битрейтом, где происходит движение или смена сцены. В итоге токены концентрируются там, где в видео действительно что-то происходит, а не размазываются равномерно по всему клипу
Авторы создали бенчмарк JumpScore, в нем модели нужно найти конкретный момент среди множества визуально почти одинаковых циклов. В нём 189 видео с прыжками на скакалке, задача - указать время начала каждого прыжка с точностью до 0,1–0,3 секунды.
LLaVA-OV-2-8B сравнивали с четырьмя моделями того же класса: Qwen3-VL-8B, Keye-VL-1.5-8B, InternVL-3.5-8B и LLaVA-OV-1.5-8B. Наибольший отрыв — на JumpScore (+44,8 пункта над Qwen3-VL) и на задачах локализации событий во времени и пространственного рассуждения. На большинстве остальных бенчмарков модель лидирует или держится в топ-2.
Код доступен на GitHub, датасеты - на Hugging Face, где также доступны веса модели.
#Stateoftheart #Benchmark
Post #1956
4.2K
- 🔥 7
- 👍 3