✅Использовать Q-Former, чтобы добавить в LLaMA возможность работать с видео и аудио модальностями
🔥Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
1) Video Q-Former для кодирования темпоральных связей между кадрами. Учим модель решать задачу описания видео (video-to-text)
2) Подход ImageBind (by FAIR) для совместного использования согласованных эмбеддингов различных модальностей (энкодеры Video Q-Former и Audio Q-Former согласованы во времени) - напомню, идея снова в использовании линейных маппингов над энкодерами и симметричной функции потерь InfoNCE для того, чтобы сблизить эмбеддинги в одном векторном пространстве
3) Файнтюнинг: инструктивный + пары «видео/картинка-описание»
📌Статья
📌GitHub
@complete_ai
Post #159
2.24K

- 🔥 14