TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #159 2.24K
✅Использовать Q-Former, чтобы добавить в LLaMA возможность работать с видео и аудио модальностями

🔥Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

1) Video Q-Former для кодирования темпоральных связей между кадрами. Учим модель решать задачу описания видео (video-to-text)

2) Подход ImageBind (by FAIR) для совместного использования согласованных эмбеддингов различных модальностей (энкодеры Video Q-Former и Audio Q-Former согласованы во времени) - напомню, идея снова в использовании линейных маппингов над энкодерами и симметричной функции потерь InfoNCE для того, чтобы сблизить эмбеддинги в одном векторном пространстве

3) Файнтюнинг: инструктивный + пары «видео/картинка-описание»

📌Статья
📌GitHub

@complete_ai
  • 🔥 14
More from @complete_ai
  1. Oct 7, 2026🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших модел…
  2. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  3. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  4. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
  5. Aug 20, 202617 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, р…
  6. Aug 20, 2026Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про бе…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →