TGViewer
Neurohive Neurohive @neurohive · 5.22K subscribers
Post #1956 4.2K
LLaVA-OneVision-2-8B: мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадров

Исследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео. Вместо того чтобы нарезать видео на равномерные кадры, модель анализирует сжатый видеопоток через кодек.

Большинство моделей просто нарезают видео на 8–32 равномерных кадра и выбрасывают остальное. Если что-то важное происходит между двумя отобранными кадрами, модель это просто пропустит. Видеокодеки вроде H.264 уже содержат информацию о том, где в видео происходят изменения, LLaVA-OV-2 использует именно её. Модель отбирает фрагменты с высоким битрейтом, где происходит движение или смена сцены. В итоге токены концентрируются там, где в видео действительно что-то происходит, а не размазываются равномерно по всему клипу

Авторы создали бенчмарк JumpScore, в нем модели нужно найти конкретный момент среди множества визуально почти одинаковых циклов. В нём 189 видео с прыжками на скакалке, задача - указать время начала каждого прыжка с точностью до 0,1–0,3 секунды.

LLaVA-OV-2-8B сравнивали с четырьмя моделями того же класса: Qwen3-VL-8B, Keye-VL-1.5-8B, InternVL-3.5-8B и LLaVA-OV-1.5-8B. Наибольший отрыв — на JumpScore (+44,8 пункта над Qwen3-VL) и на задачах локализации событий во времени и пространственного рассуждения. На большинстве остальных бенчмарков модель лидирует или держится в топ-2.

Код доступен на GitHub, датасеты - на Hugging Face, где также доступны веса модели.

#Stateoftheart #Benchmark
  • 🔥 7
  • 👍 3
More from @neurohive
  1. Sep 29, 2026🎼YuE2: открытая модель генерирует песни с редактируемой партитурой на уровне Suno v5 Кома…
  2. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  3. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  4. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  5. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  6. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →