TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #278 620
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
[код и веса]

Возвращаемся к теме мультимодальных генеративных моделей. На очереди противоположность HunyuanImage 3.0 (разбор) — самой большой модели в классе на сегодня. Авторы из Shanghai AI Lab, прародители InternVL (сторожилы помнят какой была царь-VLM до квенов 👴) дообучили FM голову на генерацию/редактирование и представляют свою новую, компактную генеративку всего текстового и визуального.

InternVL-U имеет < 4B параметров (2B VLM backbone + 1.7B generation head). Сравнительно неплохое качество достигнуто за счет огромных усилий по построению пайплайнов сбора разного рода данных. По архитектуре буквально ничего нового, поэтому далее разберем данные, обучение и бенчмаркинг.

Данные

Чтобы модель не просто рисовала красивые картинки, но и была "умной", авторы создали пайплайн синтеза данных, фокусируясь на сложных доменах:

• Reasoning-Centric Synthesis: вместо того чтобы учить модель на парах короткий промпт -> картинка, авторы используют Qwen и GPT-4o чтобы развернуть абстрактный запрос пользователя в пошаговый план (подумать, какие элементы нужны, как их расположить, какой стиль выбрать), и только потом генерировать изображение. Это учит модель рассуждать перед рисованием.

• Text Rendering: специальный пайплайн для text-centric задач — рендеринг текста на фонах и внутри изображений с использованием OCR и layout-aware генерации.

❗️ На этом пункте хочется остановиться отдельно. Во-первых, авторы показывают силу простых пайплайнов рендеринга текста на картинке (T2I) и перерисовывания через Flux-text (I2I). Они позволяют получать данные, качества которых достаточно для обучения моделей, рисующих текст на доске/стекле и т.п. Во-вторых, занятно, что, получив такие данные, даже маленький денойзер (1.7В) вполне способен выучить сложные паттерны генерации/редактирования текста на картинке.

Другие необычне данные, для которых сделали пайплайны:
• Humor & Memes — как будто просто убирают/добавляют текст на мемные картинки в нужное место
• Spatial Rotation — берут несколько кадров во время вращения 3D объектов
• Multi-view CAD — то же самое, только в CAD
• Science — данные для физики, химии (формулы, молекулы) и геометрии с использованием программных инструментов (GeoGebra, SVG, Matplotlib).

Обучение

Учат в три стадии:

1. Head Pre-training: VLM заморожена. Обучается только MMDiT-голова и проекторы на задачах генерации и редактирования (512px).
2. Any-Resolution Continued Pre-training: обучение на произвольных разрешениях (до 1024px) и соотношениях сторон. Для редактирования добавляется явная инъекция VAE-латентов исходного изображения для попиксельной точности.
3. SFT: размораживают всю модель (включая VLM). Обучение идет e2e на смеси данных, включая CoT-данные.

Результаты

• Overall (T2I): InternVL-U (4B) бьет BAGEL (14B) и приближается к Qwen-Image (20B) на GenEval и DPG-Bench.
• Text Rendering (T2I): очень сильные результаты в генерации текста (LongText-Bench, CVTG-2k), особенно на китайском и английском языках, превосходя многие специализированные модели.
• Understanding (I2T): благодаря заморозке VLM на первых этапах и decoupling-стратегии, модель не теряет SOTA-способностей к пониманию (высокие баллы на MME, MMMU).
• Editing (I2I): модель хороша на TextEdit.

Вывод

InternVL-U доказывает, что архитектуру с диффузионной головой можно дотянуть до хороших результатов данными даже при компактных размерах.
  • ❤ 10
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →