HunyuanImage 3.0 Technical Report
[код, веса]
Tensent продолжают релизы, новая HunyuanImage позиционируется как самая мощная open-source модель для генерации изображений на данный момент. В отличие от предыдущих версий, это не просто DiT-модель, это гибридная мультимодальная система, построенная на базе очень большого MoE LLM (Hunyuan-A13B) с 80B+ общих и 13B активных параметров. Модель унифицирует задачи понимания и генерации в едином фреймворке, однако для публичного доступа была выложена только её часть, отвечающая за генерацию.
Как это работает
В основе лежит "нативная мультимодальная модель" — MoE LLM, которая управляет процессом генерации. В отличие от чисто авторегрессионных подходов (OneCAT) или классических DiT, HunyuanImage 3.0 использует гибридную архитектуру, схожую с парадигмой Transfusion/JanusFlow, где LLM руководит диффузионным процессом в латентном пространстве.
Ключевые архитектурные решения
➡️Dual-Encoder
Для обработки изображений используются сразу два энкодера: VAE (с даунсэмплингом х16) для задач генерации и Vision Encoder (ViT) для задач понимания. Их признаки конкатенируются, что позволяет модели одновременно работать с разными аспектами визуальной информации.
➡️Generalized Causal Attention
Чтобы совместить авторегрессионную природу текста и "полноценное" внимание для изображений, используется специальный механизм масок. Текстовые токены видят только предыдущие токены, в то время как токены изображения могут "смотреть" на все предыдущие токены и на все остальные токены в пределах этого же изображения.
➡️Нативный CoT (Chain-of-Thought)
Модель не просто получает улучшенный промпт; она обучена сама выполнять процесс рассуждения и переписывания промпта как неотъемлемый шаг перед генерацией. Это достигается за счет обучения на специально собранном Text-to-Text-to-Image (T2TI) датасете, содержащем цепочки рассуждений.
Ключ к успеху — данные и многоэтапное обучение
Высокое качество модели — результат колоссальной работы с данными и сложного пайплайна обучения.
1️⃣ Данные
Исходный пул из 10 млрд изображений прошел через 3-этапную фильтрацию (удаление дубликатов, низкого качества, AIGC-контента, оценка эстетики). Была разработана продвинутая система иерархического двуязычного капченинга, которая генерирует описания разной степени детализации и использует специализированные "агенты" (OCR, Named Entity) для проверки фактов.
2️⃣ Прогрессивное предобучение
Обучение разделено на 4 стадии с постепенным увеличением разрешения изображений и добавлением более сложных данных (например, interleaved-data на 3-й стадии и CoT-данные на 4-й).
3️⃣”Агрессивный" пост-тренинг
После предобучения модель проходит целый каскад выравнивающих процедур: SFT, DPO (для устранения артефактов), MixGRPO (для улучшения эстетики и выравнивания с текстом), SRPO и новый внутренний метод ReDA для повышения реализма.
Как мерились
Авторы справедливо критикуют существующие бенчмарки (T2I-CompBench, GenEval) за примитивные промпты и ненадёжные автоматические метрики. Вместо них они предлагают собственный фреймворк SSAE (Structured Semantic Alignment Evaluation). В нём LLM сначала парсит промпт на 12 семантических полей (объекты, атрибуты, сцена и т.д.), а затем более продвинутая MLLM с CoT оценивает сгенерированное изображение по каждому из этих пунктов.
По результатам человеческой оценки, HunyuanImage 3.0 значительно превосходит предыдущую версию 2.1 и конкурирует на равных с ведущими закрытыми моделями (Seedream 4.0, GPT-Image).
Вместо вывода
HunyuanImage 3.0 — это демонстрация мощи современного индастриал-ML. Успех модели кроется не в одном прорывном архитектурном решении, а в синергии четырёх факторов: огромный масштаб MoE LLM, проработанный пайплайн подготовки данных, многоступенчатое прогрессивное обучение и каскад из самых современных RL-техник.
В любом случае, это новый и очень высокий стандарт для open-source комьюнити.
Post #259
711

- 🫡 6
- 🔥 3