TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #279 659
Beyond Language Modeling: An Exploration of Multimodal Pretraining
[ни кода, ни весов нет]

Команда из FAIR и NYU (LeCun team 👦) представила масштабное эмпирическое исследование по обучению нативных унифицированных мультимодальных моделей (UMM) с нуля. В скоуп работы попадают и VLM и мультимодальные генеративки.

Большинство текущих подходов берут уже готовую LLM и пытаются прикрутить к ней зрение. Авторы же решили ответить на фундаментальный вопрос: как разные архитектурные и датасетные решения влияют на модель, если учить язык и зрение с нуля и одновременно?

В работе используют фреймворк Transfusion (разбор): один трансформер, где для текста считается next-token prediction, а для картинки/видео — Flow Matching.

Визуальные представления

Авторы сравнили спектр энкодеров: VAE (SD-VAE, FLUX.1), семантические (SigLIP 2, DINOv2, WebSSL) и "сырые" пиксели.

RAE (Representation Autoencoders) — победитель. Использование эмбеддингов SigLIP 2 вместо VAE-латентов (как это делается в большинстве UMM) дает лучшие результаты и в понимании (VQA), и в генерации (GenEval, DPGBench). VAE хорош для восстановления пикселей, но теряет семантику, важную для понимания. RAE-подход позволяет использовать один высокоразмерный энкодер для обеих задач, существенно упрощая архитектуру по сравнению с dual-encoder системами как в Janus или BAGEL.

Данные: конкурируют ли модальности?

Главный страх мультимодального претрейна: зрение испортит язык. Второй страх: не испортит, но и не поможет. Что выяснили:

1️⃣ Обучение на сыром видео (без текста) параллельно с текстом улучшает (или не ухудшает) языковую перплексию по сравнению с чисто текстовым бейзлайном.

2️⃣ Деградация языка возникает только при добавлении image-text (I/T) пар (например, MetaCLIP). Авторы доказали, что это не из-за зрения, а из-за сдвига распределения текста - кэпшены сильно отличаются от веб-текста.

3️⃣ Добавление текста к фиксированному бюджету визуальных токенов улучшает качество генерации картинок.

Наблюдения

Способность к world modeling эмерджентна. Добавление общего видео-корпуса к всего 1% in-domain (50B токенов) дает результаты, сравнимые с обучением на 100B токенах только in-domain данных. Более того, модель способна воспринимать free-form текст как управляющие action'ы в zero-shot режиме (например, "get out of the shadow", "take big steps forward").

Архитектура и масштабирование

Вместо стандартного shared Transformer авторы исследовали разделение capacity.

➡️Modality-Specific FFNs: Простое создание двух независимых FFN (для текста и для vision) внутри каждого слоя, при сохранении shared Attention, уже снижает конкуренцию модальностей.

➡️MoE — самая эффективная архитектура. Также интересно, что модель выделяет больше экспертов под текст. При этом для генерации (T2I) и понимания картинки (I2T) активируются одни и те же "визуальные" эксперты.

➡️Scaling Asymmetry (Chinchilla IsoFLOPs): Для плотных (dense) моделей масштабные законы асимметричны. Текст требует сбалансированного роста, а зрение в разы прожорливее к данным. Из-за этой асимметрии невозможно подобрать идеальный оптимальный бюджет для обеих модальностей сразу. Введение MoE сглаживает этот разрыв.

Вывод

Штраф за мультимодальность — это миф дизайна, а не фундаментальное свойство. Используя одно мощное семантическое представление (RAE), независимые или MoE FFN-блоки и правильный микс данных, можно обучить нативную UMM с нуля. Такая модель не только не теряет в языковых навыках, но и естественным образом перенимает свойства World Models для zero-shot планирования навигации в пространстве.
  • ❤ 7
  • 👍 2
  • 🔥 2
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →