TGViewer
The Layer The Layer @layercv · 852 subscribers
Post #85 2.72K
Интересная работа MoAI: Mixture of All Intelligence for Large Language and Vision Models по теме больших мультимодальных нейросетей.

Высокоуровневно: в компьютерном зрении исторически накоплено много крутых специализированных моделей, которые до сих пор в части областей выносят даже огроменные мультимодальные нейросети. Почему бы всё это тогда просто не объединить? Всё равно там в скорости терять уже нечего 😳

В общем, авторы берут сильные модели из следующих областей: panoptic segmentation (instance + semantic сегментация изображения), open-world object detection (обнаружение объектов без предварительно заданных классов), scene graph generation (создание графа сцены, описывающего взаимосвязи между объектами на изображении) и OCR (распознавание символов). Конкретные модели приводить не буду, они подробно расписаны в разделе 4.
Главное – суммарно все веса спец. моделей составляют 332кк, т.е. мелочи на фоне LLM.

Чтобы всё это сварить вводят два новых модуля: MoAI-Compressor и MoAI-Mixer.
MoAI-Compressor сжимает информацию, поступающую от специализированных моделей. Её перед этим предварительно вербализируют, по сути, приводят к естественному языку (отдельная возня с сегментацией, там кодируют также и всю карту).
MoAI-Mixer смешивает всю поступающую информацию (экспертную, визуальную и языковую) при помощи 6 модулей-экспертов. Почему 6? Процитирую:
Specifically, MoAI facilitates pairs of (1) visual-auxiliary feature, (2) visual-language feature, (3) visual-visual feature, (4) language-auxiliary feature, (5) language-visual feature, and (6) language-language feature. Each pair is considered as a query-key pair for a respective cross- or self-attention module serving as experts, clarifying the fusion of information across diverse modalities.

Примечательно, что на этапе тренировки разморожены только эти два модуля.

Ну и, в конечном счёте, всё попадает в MLLM уже стандартной архитектуры, в которой визуальный энкодер это CLIP-L/14, а LLM – мультиязыковая InternLM-7B.

Результаты, с учётом размера модели 🔥
Код тут
  • 👍 7
  • 🔥 6
  • ❤ 2
  • 🗿 1
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →