TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #264 919
Transfer between Modalities with MetaQueries
[страничка с кодом и данными]

Выше мы много обсуждали мультимодальные модели, способные одновременно понимать и генерировать картинки и текст. Архитектурно, для создания таких моделей сейчас предлагается два подхода:
1. Учить генеративную картиночную голову поверх VLM (Nexus-Gen, Qwen-Image);
2. Учить, условно, unified модель, которая будет генерить сразу картинки и текст (BAGEL, Transfusion, Show-o).

В первом случае надо подумать как именно передавать инфу из VLM в картиночный генератор. Обычно в качестве такого генератора используют диффузионку. Тогда, если представить, что VLM — это просто текстовый энкодер, то можно использовать наиболее популярный интерфейс — подавать в денойзер текстовые эмбединги с последних слоёв VLM. Так делать можно, но авторы этой работы утверждают, что есть способ получше и предлагают подход MetaQueries.

Идея и метод

MetaQueries — это набор небольшого количества обучаемых векторов (queries), которые подаются на вход замороженной VLM вместе с обычным промптом (текстом и/или изображением). Эти "мета-запросы" заставляют VLM извлечь из своих латентных представлений всю необходимую информацию для генерации.

Полученные на выходе представления от MetaQueries затем через небольшой обучаемый коннектор (трансформер-энкодер) подаются в качестве условия (condition) в любую предобученную диффузионнку, заменяя ее стандартный текстовый энкодер.

Весь процесс обучения сводится к простой и стабильной задаче: обучить MetaQueries и коннектор на обычных парах (картинка, промт) с любым вариантом диффузионного лосса.

Метод сильно напоминает Q-Former с двумя отличиями:
- В MetaQueries нужно прокидывать градиенты через энкодер (VLM);
- В MetaQueries картиночный condition подаётся прям на вход, а не через cross-attn коннектора.

Эксперименты и результаты

Авторы учат коннекторы размера от 84М до 2В между весьма мелкими LLaVA-OneVision-0.5 и Sana-0.6B в претрен сетапе (lr=1e-4, bs=4096) порядка 50к итераций чтобы показать FID MJHQ-30k порядка 6 и GenEval порядка 0.6 😂 (ладно-ладно, скидка на мелкие VLM и денойзер).

Важно, что в процессе проаблейтили и на цифрах показали, что:
- Дообучение без разморозки VLM даёт примерно такое же качество как с разморозкой но без MetaQueries;
- Больше длина последовательности queries — не всегда лучше (есть некая золотая середина);
- По бенчам метод действительно лучше чем просто брать эмбеды с последнего слоя

Еще понравилось, что с помощью MetaQueries можно почти идеально выучить реконструкцию картинок. Это значит, что метод позволяет довольно детально пробрасывать через VLM картиночную инфу, что полезно для задач с использованием картиночного condition’a.

Не понравилось, что надо пропускать градиенты через VLM. На практике может оказаться, что Q-Former даёт примерно такое же качество без дополнительных инженерных приседаний.
  • 👍 6
  • ❤ 3
  • 🥰 1
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →