Beyond Language Modeling: An Exploration of Multimodal Pretraining
[ни кода, ни весов нет]
Команда из FAIR и NYU (LeCun team 👦) представила масштабное эмпирическое исследование по обучению нативных унифицированных мультимодальных моделей (UMM) с нуля. В скоуп работы попадают и VLM и мультимодальные генеративки.
Большинство текущих подходов берут уже готовую LLM и пытаются прикрутить к ней зрение. Авторы же решили ответить на фундаментальный вопрос: как разные архитектурные и датасетные решения влияют на модель, если учить язык и зрение с нуля и одновременно?
В работе используют фреймворк Transfusion (разбор): один трансформер, где для текста считается next-token prediction, а для картинки/видео — Flow Matching.
Визуальные представления
Авторы сравнили спектр энкодеров: VAE (SD-VAE, FLUX.1), семантические (SigLIP 2, DINOv2, WebSSL) и "сырые" пиксели.
RAE (Representation Autoencoders) — победитель. Использование эмбеддингов SigLIP 2 вместо VAE-латентов (как это делается в большинстве UMM) дает лучшие результаты и в понимании (VQA), и в генерации (GenEval, DPGBench). VAE хорош для восстановления пикселей, но теряет семантику, важную для понимания. RAE-подход позволяет использовать один высокоразмерный энкодер для обеих задач, существенно упрощая архитектуру по сравнению с dual-encoder системами как в Janus или BAGEL.
Данные: конкурируют ли модальности?
Главный страх мультимодального претрейна: зрение испортит язык. Второй страх: не испортит, но и не поможет. Что выяснили:
1️⃣ Обучение на сыром видео (без текста) параллельно с текстом улучшает (или не ухудшает) языковую перплексию по сравнению с чисто текстовым бейзлайном.
2️⃣ Деградация языка возникает только при добавлении image-text (I/T) пар (например, MetaCLIP). Авторы доказали, что это не из-за зрения, а из-за сдвига распределения текста - кэпшены сильно отличаются от веб-текста.
3️⃣ Добавление текста к фиксированному бюджету визуальных токенов улучшает качество генерации картинок.
Наблюдения
Способность к world modeling эмерджентна. Добавление общего видео-корпуса к всего 1% in-domain (50B токенов) дает результаты, сравнимые с обучением на 100B токенах только in-domain данных. Более того, модель способна воспринимать free-form текст как управляющие action'ы в zero-shot режиме (например, "get out of the shadow", "take big steps forward").
Архитектура и масштабирование
Вместо стандартного shared Transformer авторы исследовали разделение capacity.
➡️Modality-Specific FFNs: Простое создание двух независимых FFN (для текста и для vision) внутри каждого слоя, при сохранении shared Attention, уже снижает конкуренцию модальностей.
➡️MoE — самая эффективная архитектура. Также интересно, что модель выделяет больше экспертов под текст. При этом для генерации (T2I) и понимания картинки (I2T) активируются одни и те же "визуальные" эксперты.
➡️Scaling Asymmetry (Chinchilla IsoFLOPs): Для плотных (dense) моделей масштабные законы асимметричны. Текст требует сбалансированного роста, а зрение в разы прожорливее к данным. Из-за этой асимметрии невозможно подобрать идеальный оптимальный бюджет для обеих модальностей сразу. Введение MoE сглаживает этот разрыв.
Вывод
Штраф за мультимодальность — это миф дизайна, а не фундаментальное свойство. Используя одно мощное семантическое представление (RAE), независимые или MoE FFN-блоки и правильный микс данных, можно обучить нативную UMM с нуля. Такая модель не только не теряет в языковых навыках, но и естественным образом перенимает свойства World Models для zero-shot планирования навигации в пространстве.
Post #279
659


- ❤ 7
- 👍 2
- 🔥 2