TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #304 590
Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия?

В мае 2025 BAGEL и близкие по времени работы продавали унифицированные модели с одним набором весов на понимание и генерацию картинок. Мотивационный тезис — модальности взаимно усиливают друг друга. Экспериментальных подтверждений тогда было немного, но авторы смотрели в светлое будущее. Прошло 14 месяцев. Посмотрим, что реально измерили за это время.

Что говорит литература

▶️ Are Unified VLMs Necessary (май 2025). Единственная известная мне работа, где синергию померили чисто и на изолированной задаче. На синтетическом UI-датасете VQA-точность растёт с 76.6 до 98.7, FID падает с 210.9 до 190.2 при совместном обучении. Валидация на реальных данных (ShareGPT4V) сделана в куда меньшем масштабе, и там эффект уже скромнее.

▶️ FAIR Beyond Language Modeling (март 2026). Смесь текста и видео в претрене совместима с чисто текстовым бейзлайном, а иногда даже его обыгрывает по перплексити. А вот добавление картиночно-текстовых кепшенов (MetaCLIP) в тот же микс даёт худшую текстовую перплексити среди всех рассмотренных смесей. Тот самый налог за мультимодальность теперь измерен на пре-трейне.

▶️ Do Understanding and Generation Fight? (март 2026). Диагностика прямо на Janus-Pro (7B и 1B): попытка одновременно улучшить понимание и генерацию через DPO. На 7B ни один метод не двигает генерационный CLIPScore, на 1B все методы генерацию ухудшают. Градиенты двух задач почти ортогональны (cos ~ 0), а их магнитуды различаются в 11-14 раз — сигналы буквально дерутся между собой. Причина по мнению авторов в дисбалансе информации (~576 токенов на картинку против 30-100 на текст).

▶️ Сам BAGEL — это Mixture-of-Transformer с раздельными параметрами и общим self-attn. С точки зрения весов это уже частичное разделение, спрятанное под словом "унифицированная".

▶️ BLIP3-o и UniFork. Первая показывает, что последовательный претрен (сначала понимание, потом генерация) сохраняет понимание лучше, чем полностью совместный. Вторая ловит, что две задачи хотят противоположных траекторий алаймента модальностей по глубине модели, то есть полностью общий бэкбон противоречит обеим.

Замечания

Во-первых, чистого аблейшена (тот же датасет, та же архитектура, совместно против пары специализированных) на большом скейле за 14 месяцев так и не появилось. Зато появился анализ градиентов, показывающий, что сигналы двух задач ортогональны на уровне обновлений весов. Синергия не опровергнута окончательно, но её измеряют всё хуже, а интерференцию — всё лучше.

Во-вторых, все успешные "унифицированные" системы явно или неявно прячут разделение: в энкодерах (Janus), в раздельных параметрах и MoT (BAGEL), в порядке обучения (BLIP3-o), в отдельных ветках (UniFork). Возможно, это тихое признание сообществом того, что базовое совместное обучение скорее вредит, чем помогает.

В-третьих, параллельно расцвела агентская парадигма: оркестратор берёт две сильные специализированные модели (VLM для понимания, T2I/T2V для генерации), пользуется ими как инструментами и склеивает результаты. На сквозных задачах агентский подход зачастую бьёт унифицированные модели, не сражаясь ни с какой интерференцией между модальностями.

На мой вкус

Обещанное майскими работами 2025-го светлое будущее пока не наступило. Взаимное усиление модальностей реально существует в узких сетапах и на уровне представлений, но не превращается в убедительный практический выигрыш на скейле, а именно этот выигрыш и продавали. Инфраструктурная сложность унифицированных моделей выше, чем у пары специализированных плюс роутер, поэтому бо́льшая часть прод-систем идёт агентским путём. Пока не появится независимой аблейшн на большом скейле — разговор так и будет крутиться вокруг архитектурных уловок.
  • 👍 6
  • ❤ 2
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jun 29, 2026Результаты На IA-Bench Qwen-Image-Agent даёт IA-score 45.4. Для контекста: • Nano Banana P…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →