TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #294 508
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
[кода/весов не вижу]

Интересная работа про unified multimodal models, но не про улучшение генерации через понимание, как обычно в BAGEL/BLIP3-o-like системах, а наоборот: может ли генерация улучшать понимание?

Авторы называют это G2U (Generation-to-Understanding). Идея простая: перед ответом на вопрос модель сначала генерирует вспомогательную картинку — visual thought — а потом использует и исходное изображение, и эту сгенерированную версию для финального ризонинга.

Пайплайн

1. Visual Thought Generation: модель делает контролируемое редактирование исходного изображения.
2. Understanding via Feedback: исходное изображение + visual thought + вопрос подаются обратно в ветку понимания.
3. Edit prompt пишет отдельный prompt writer (GPT-4o-mini, 5-shot ICL).

Типы visual thoughts:
• Enhancement: denoise, deblur, exposure correction.
• Expansion: outpainting, zoom-in, viewpoint translation, removing distractors, structural visualization.

Результаты

Модель тестируют BAGEL 7B. Сравнивают ванильный BAGEL, textual CoT и разные варианты G2U. Забавно, что textual CoT в среднем хуже бейзлайна, а visual thinking лучше: BAGEL+G2U даёт прирост на HallusionBench (+4.2), R-Bench (+1.6), MMStar (+1.2), MMBench (+1.8). На их VisThink-Bench (1595 семплой, 34 задач) самые большие улучшения в 3D height estimation, illusion reasoning и color recognition.

Главное наблюдение: качество generated visual thought реально ограничивает прирост понимания. Чем выше semantic consistency и perceptual quality у сгенерированной картинки, тем больше итоговый прирост качества. То есть “воображение” помогает только пока оно достаточно “правдоподобное”.

Ограничения тоже понятные:

• text/charts/symbol-heavy задачи могут проседать из-за потери мелких деталей;
• Абстрактные промты для редактирования иногда создают циклический ризонинг (но это как будто проблема +- всех моделей);
• модель пока плохо выбирает, что именно ей надо “вообразить” для задачи. Self-prompt работает хуже, чем внешний GPT-4o-mini prompt writer.

Мне нравится эта работа скорее как правильная постановка вопроса. Unified models часто продаются как “понимание + генерация в одной системе”, но на практике связь почти всегда односторонняя: поняли → нарисовали. Здесь проверяют обратную сторону: нарисовали → лучше поняли.
  • ❤ 2
  • 👍 1
  • 🔥 1
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →