⚡️Свежий апдейт LLaVA-NeXT
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
LLaVA-NeXT — опенсурс мультимодальная диалоговая модель для работы с картинками и текстом.
Основной контрибьют — добавили разные режимы «перемешанных» (interleaved) изображений и текстов. Таким образом модель может решать задачи с одной картинкой, несколькими изображениями, несколькими кадрами видео и несколькими ракурсами одного объекта (полезно кстати для задач робототехники и анализа картины мира).
Все эти задачи заправлены в новый M4-Instruct сет на 1+M сэмплов. И также есть бенч на этот же спектр задач.
Архитектурно — ничего нового. Обучали с модели, которая до этого работала только с одной картинкой, то есть тюн с изменением структуры диалога хорошо ложится поверх VLM (совершенное открытие!).
Но безусловно, очень ценны данные и бенч.
🟢Статья
🟢Код
🟢M4-Instruct
@complete_ai
Post #436
4.95K

- 🔥 11
- ⚡ 10
- 👌 3