На днях появилась в открытом доступе очередная SOTA VLM-модель Molmo2 для понимания видео, которая полезна для описания сцены и трекинга объектов на ней. К этой работе авторы из Allen AI приложили также собственные размеченные видео-датасеты
Статья: Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding https://arxiv.org/abs/2601.10611
Блог https://allenai.org/blog/molmo2
Код https://github.com/allenai/molmo2
Модели https://huggingface.co/collections/allenai/molmo2
Датасеты https://huggingface.co/collections/allenai/molmo2-data
#References
Post #424
285

- 🔥 3