😎📊Данные, используемые при обучении MA-LMM-модели
MA-LMM (Memory-Augmented Large Multimodal Model) - это большая мультимодальная модель с расширенной памятью для понимания контекста длинных видео.
Модель позволяет использовать длинный контекст за счет существенного сокращения использования памяти графического процессора. Вместо того, чтобы пытаться обрабатывать больше кадров одновременно, как в большинстве существующих моделей, MA-LMM обрабатывает видео онлайн с сохранением прошлой информации в банк памяти.
В открытый доступ выложили данные, на которых обучалась модель. Эти данные представляют собой 2 весьма больших датасета, которые можно загрузить по этой ссылке
Post #549
804