TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #259 711
HunyuanImage 3.0 Technical Report
[код, веса]

Tensent продолжают релизы, новая HunyuanImage позиционируется как самая мощная open-source модель для генерации изображений на данный момент. В отличие от предыдущих версий, это не просто DiT-модель, это гибридная мультимодальная система, построенная на базе очень большого MoE LLM (Hunyuan-A13B) с 80B+ общих и 13B активных параметров. Модель унифицирует задачи понимания и генерации в едином фреймворке, однако для публичного доступа была выложена только её часть, отвечающая за генерацию.

Как это работает

В основе лежит "нативная мультимодальная модель" — MoE LLM, которая управляет процессом генерации. В отличие от чисто авторегрессионных подходов (OneCAT) или классических DiT, HunyuanImage 3.0 использует гибридную архитектуру, схожую с парадигмой Transfusion/JanusFlow, где LLM руководит диффузионным процессом в латентном пространстве.

Ключевые архитектурные решения

➡️Dual-Encoder
Для обработки изображений используются сразу два энкодера: VAE (с даунсэмплингом х16) для задач генерации и Vision Encoder (ViT) для задач понимания. Их признаки конкатенируются, что позволяет модели одновременно работать с разными аспектами визуальной информации.

➡️Generalized Causal Attention
Чтобы совместить авторегрессионную природу текста и "полноценное" внимание для изображений, используется специальный механизм масок. Текстовые токены видят только предыдущие токены, в то время как токены изображения могут "смотреть" на все предыдущие токены и на все остальные токены в пределах этого же изображения.

➡️Нативный CoT (Chain-of-Thought)
Модель не просто получает улучшенный промпт; она обучена сама выполнять процесс рассуждения и переписывания промпта как неотъемлемый шаг перед генерацией. Это достигается за счет обучения на специально собранном Text-to-Text-to-Image (T2TI) датасете, содержащем цепочки рассуждений.

Ключ к успеху — данные и многоэтапное обучение

Высокое качество модели — результат колоссальной работы с данными и сложного пайплайна обучения.

1️⃣ Данные
Исходный пул из 10 млрд изображений прошел через 3-этапную фильтрацию (удаление дубликатов, низкого качества, AIGC-контента, оценка эстетики). Была разработана продвинутая система иерархического двуязычного капченинга, которая генерирует описания разной степени детализации и использует специализированные "агенты" (OCR, Named Entity) для проверки фактов.

2️⃣ Прогрессивное предобучение
Обучение разделено на 4 стадии с постепенным увеличением разрешения изображений и добавлением более сложных данных (например, interleaved-data на 3-й стадии и CoT-данные на 4-й).

3️⃣”Агрессивный" пост-тренинг
После предобучения модель проходит целый каскад выравнивающих процедур: SFT, DPO (для устранения артефактов), MixGRPO (для улучшения эстетики и выравнивания с текстом), SRPO и новый внутренний метод ReDA для повышения реализма.

Как мерились

Авторы справедливо критикуют существующие бенчмарки (T2I-CompBench, GenEval) за примитивные промпты и ненадёжные автоматические метрики. Вместо них они предлагают собственный фреймворк SSAE (Structured Semantic Alignment Evaluation). В нём LLM сначала парсит промпт на 12 семантических полей (объекты, атрибуты, сцена и т.д.), а затем более продвинутая MLLM с CoT оценивает сгенерированное изображение по каждому из этих пунктов.

По результатам человеческой оценки, HunyuanImage 3.0 значительно превосходит предыдущую версию 2.1 и конкурирует на равных с ведущими закрытыми моделями (Seedream 4.0, GPT-Image).

Вместо вывода

HunyuanImage 3.0 — это демонстрация мощи современного индастриал-ML. Успех модели кроется не в одном прорывном архитектурном решении, а в синергии четырёх факторов: огромный масштаб MoE LLM, проработанный пайплайн подготовки данных, многоступенчатое прогрессивное обучение и каскад из самых современных RL-техник.

В любом случае, это новый и очень высокий стандарт для open-source комьюнити.
  • 🫡 6
  • 🔥 3
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →