InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
[код и веса]
Возвращаемся к теме мультимодальных генеративных моделей. На очереди противоположность HunyuanImage 3.0 (разбор) — самой большой модели в классе на сегодня. Авторы из Shanghai AI Lab, прародители InternVL (сторожилы помнят какой была царь-VLM до квенов 👴) дообучили FM голову на генерацию/редактирование и представляют свою новую, компактную генеративку всего текстового и визуального.
InternVL-U имеет < 4B параметров (2B VLM backbone + 1.7B generation head). Сравнительно неплохое качество достигнуто за счет огромных усилий по построению пайплайнов сбора разного рода данных. По архитектуре буквально ничего нового, поэтому далее разберем данные, обучение и бенчмаркинг.
Данные
Чтобы модель не просто рисовала красивые картинки, но и была "умной", авторы создали пайплайн синтеза данных, фокусируясь на сложных доменах:
• Reasoning-Centric Synthesis: вместо того чтобы учить модель на парах короткий промпт -> картинка, авторы используют Qwen и GPT-4o чтобы развернуть абстрактный запрос пользователя в пошаговый план (подумать, какие элементы нужны, как их расположить, какой стиль выбрать), и только потом генерировать изображение. Это учит модель рассуждать перед рисованием.
• Text Rendering: специальный пайплайн для text-centric задач — рендеринг текста на фонах и внутри изображений с использованием OCR и layout-aware генерации.
❗️ На этом пункте хочется остановиться отдельно. Во-первых, авторы показывают силу простых пайплайнов рендеринга текста на картинке (T2I) и перерисовывания через Flux-text (I2I). Они позволяют получать данные, качества которых достаточно для обучения моделей, рисующих текст на доске/стекле и т.п. Во-вторых, занятно, что, получив такие данные, даже маленький денойзер (1.7В) вполне способен выучить сложные паттерны генерации/редактирования текста на картинке.
Другие необычне данные, для которых сделали пайплайны:
• Humor & Memes — как будто просто убирают/добавляют текст на мемные картинки в нужное место
• Spatial Rotation — берут несколько кадров во время вращения 3D объектов
• Multi-view CAD — то же самое, только в CAD
• Science — данные для физики, химии (формулы, молекулы) и геометрии с использованием программных инструментов (GeoGebra, SVG, Matplotlib).
Обучение
Учат в три стадии:
1. Head Pre-training: VLM заморожена. Обучается только MMDiT-голова и проекторы на задачах генерации и редактирования (512px).
2. Any-Resolution Continued Pre-training: обучение на произвольных разрешениях (до 1024px) и соотношениях сторон. Для редактирования добавляется явная инъекция VAE-латентов исходного изображения для попиксельной точности.
3. SFT: размораживают всю модель (включая VLM). Обучение идет e2e на смеси данных, включая CoT-данные.
Результаты
• Overall (T2I): InternVL-U (4B) бьет BAGEL (14B) и приближается к Qwen-Image (20B) на GenEval и DPG-Bench.
• Text Rendering (T2I): очень сильные результаты в генерации текста (LongText-Bench, CVTG-2k), особенно на китайском и английском языках, превосходя многие специализированные модели.
• Understanding (I2T): благодаря заморозке VLM на первых этапах и decoupling-стратегии, модель не теряет SOTA-способностей к пониманию (высокие баллы на MME, MMMU).
• Editing (I2I): модель хороша на TextEdit.
Вывод
InternVL-U доказывает, что архитектуру с диффузионной головой можно дотянуть до хороших результатов данными даже при компактных размерах.
Post #278
620

- ❤ 10