Высокоуровневно: в компьютерном зрении исторически накоплено много крутых специализированных моделей, которые до сих пор в части областей выносят даже огроменные мультимодальные нейросети. Почему бы всё это тогда просто не объединить? Всё равно там в скорости терять уже нечего 😳
В общем, авторы берут сильные модели из следующих областей: panoptic segmentation (instance + semantic сегментация изображения), open-world object detection (обнаружение объектов без предварительно заданных классов), scene graph generation (создание графа сцены, описывающего взаимосвязи между объектами на изображении) и OCR (распознавание символов). Конкретные модели приводить не буду, они подробно расписаны в разделе 4.
Главное – суммарно все веса спец. моделей составляют 332кк, т.е. мелочи на фоне LLM.
Чтобы всё это сварить вводят два новых модуля: MoAI-Compressor и MoAI-Mixer.
MoAI-Compressor сжимает информацию, поступающую от специализированных моделей. Её перед этим предварительно вербализируют, по сути, приводят к естественному языку (отдельная возня с сегментацией, там кодируют также и всю карту).
MoAI-Mixer смешивает всю поступающую информацию (экспертную, визуальную и языковую) при помощи 6 модулей-экспертов. Почему 6? Процитирую:
Specifically, MoAI facilitates pairs of (1) visual-auxiliary feature, (2) visual-language feature, (3) visual-visual feature, (4) language-auxiliary feature, (5) language-visual feature, and (6) language-language feature. Each pair is considered as a query-key pair for a respective cross- or self-attention module serving as experts, clarifying the fusion of information across diverse modalities.
Примечательно, что на этапе тренировки разморожены только эти два модуля.
Ну и, в конечном счёте, всё попадает в MLLM уже стандартной архитектуры, в которой визуальный энкодер это CLIP-L/14, а LLM – мультиязыковая InternLM-7B.
Результаты, с учётом размера модели 🔥
Код тут

