TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1118 1.59K

Forwarded from Machinelearning

🔥 VideoLLaMA 3: Frontier Multimodal Foundation Models for Video Understanding


VideoLLaMA - это серия мультимодальных моделей (MLLM), разработанных для различных задач понимания изображений и видео!

🌟 Модели поддерживают возможности обработки текста, изображений и видео.

Модели подойдут для создания универсальных приложений, способных решать широкий спектр задач, связанных с анализом визуальной информации.

🖐️Результаты 7B модели: DocVQA: 94,9, MathVision: 26,2, VideoMME: 66,2/70,3, MLVU: 73,0
🤏 Результаты 2B-модели для мобильных устройств: MMMU: 45.3, VideoMME: 59.6/63.4

🔐 Лицензирование: Apache-2.0

▪ Github: https://github.com/DAMO-NLP-SG/VideoLLaMA3
▪Image Demo: https://huggingface.co/spaces/lixin4ever/VideoLLaMA3-Image
▪Video Demo: https://huggingface.co/spaces/lixin4ever/VideoLLaMA3

@ai_machinelearning_big_data

#video #MLLM #opensource #VideoLLaMA #VideoUnderstanding
  • 🔥 4
  • 👍 2
More from @bigdatai
  1. Oct 8, 2026Хватит переписывать промпты: что такое harness engineering Почему ИИ-агенты ломаются даже…
  2. Oct 8, 2026ChatGPT PRO - полный курс на русском Практический курс по ChatGPT: от первого промпта до а…
  3. Oct 7, 2026Свежие данные из интернета для ИИ-агента - одним вызовом API Чтобы ИИ-ассистент отвечал с…
  4. Oct 6, 2026Яндекс открыл YTsaurus Flow: 100+ ГБ/с в реальном времени без потерь и дублей Технология о…
  5. Oct 6, 2026Claude и вопрос сознания: что не так с конституцией модели Разбор критики конституции Clau…
  6. Oct 4, 2026🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов На GitHub вы…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →