TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #293 589
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
[код и веса]

Inclusion AI делает unified multimodal dLLM для understanding + generation. В отличие от MAR / Fluid / UniFluid / NexusGen, где генерация строится вокруг AR/MAR-предсказания visual tokens/latents, и от Qwen-Image / HunyuanImage / BAGEL / Transfusion, где обычно есть отдельный VLM/LLM и diffusion/flow head или гибрид NTP + diffusion, здесь ставка на общий discrete diffusion backbone: текст и semantic visual tokens учатся через один block-wise mask prediction objective.

Важное уточнение: Diffusion Decoder тут всё равно отдельный. Поэтому это не «один модуль для всего». Унификация скорее в том, что understanding и generation сходятся в одном dLLM-пространстве SigLIP-VQ токенов; decoder только превращает эти semantic tokens обратно в картинку.


Архитектура


•
SigLIP-VQ tokenizer: картинка кодируется не VAE-like реконструктивными токенами, а семантическими дискретными токенами. Codebook: 16,384 токена, dim 2048. Это должно помогать understanding-задачам, где обычные VQ-VAE токены часто теряют семантику.

• Backbone: 16B MoE dLLM на базе LLaDA2.0-mini. Текстовые и визуальные токены моделируются через block-level masked diffusion objective.

• Diffusion Decoder: отдельный decoder на базе Z-Image-Base, который восстанавливает картинку из semantic visual tokens. То есть dLLM генерирует не пиксельные латенты, а семантические токены, а уже decoder превращает их в изображение.

SPRINT acceleration

Training-free ускорение для dLLM-инференса:
• Sparse prefix retention: прунят KV-cache, причём image tokens можно резать агрессивнее, чем text tokens;
• Non-uniform token unmasking: токены размаскируются не по фиксированному расписанию, а по confidence.

По таблицам это даёт ~1.6x speedup при небольшом среднем падении качества (-0.6 score). Но есть заметные просадки на OCRBench и DPG, что логично: раннее принятие токенов хуже работает там, где важны точные символы и детали.

Данные и обучение

Три стадии:
1. Vision-language alignment: image-caption + text, генерация 256 → 512.
2. Multi-task pretraining: OCR, grounding, counting, VQA, T2I, editing, interleaved generation.
3. SFT: 8k → 16k context, high-quality VQA, генерация, редактирование, CoT и interleaved reasoning.

Для T2I собрали 200M web image-text, после фильтрации осталось 140M. Отдельно увеличивали долю human body и rendered text. Для editing смешивают open-source датасеты и свои синтетические пары, фильтруя/переписывая инструкции через Qwen3-VL.

Результаты

На understanding модель действительно сильно закрывает разрыв с VLM: местами на уровне Qwen2.5-VL-7B, при этом заметно лучше предыдущих diffusion unified моделей.

В генерации:
• GenEval: 0.89, лучший результат среди unified моделей.
• DPG: 87.76, тоже сильный уровень.
• CVTG-2K: лучшая среди unified моделей по text rendering, но dense text всё ещё остаётся слабым местом.
• WISE-Bench: reasoning mode даёт +10%, что хорошо ложится в идею “сначала подумать, потом нарисовать”.

В editing результаты смешанные. На ImgEdit модель лучшая среди unified, но на GEdit уступает специализированным редакторам вроде Qwen-Image-Edit / Z-Image-Edit. Зато на multi-reference editing MICo-Bench показывает SOTA среди сравниваемых моделей: 47.1 overall.

Что важно

Мне кажется, главный вклад не в абсолютном SOTA по каждой задаче, а в аккуратной попытке сделать unified diffusion-LLM без dual-encoder костылей: один semantic discrete tokenizer, один dLLM backbone, один mask prediction objective.

Но слабые места тоже честно видны:
• SigLIP-VQ хорошо несёт семантику, но хуже сохраняет fine-grained details.
• Dense text rendering пока не на уровне лучших специализированных моделей.
• Interleaved reasoning выглядит скорее как ранняя демонстрация направления, чем как полностью зрелая capability.

В целом это одна из самых интересных работ в линии unified multimodal генеративок: ближе не к “VLM + DiT head”, а к настоящей общей дискретной модели для understanding и generation.
  • 🔥 7
  • ❤ 3
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →