Qwen-Image-2.1 есть у нас дома
на легком текстовом энкодере. Вместо родного Qwen3-VL-8B (17.5 ГБ) - Qwen3.5-0.8B и 158M адаптер внутри DiT. Целая папка diffusers без тяжелого энкодера, экономия почти 16 ГБ
• text-to-image, редактирование сцен и персонажей, прозрачный RGBA в одном пайплайне
• до нескольких референсов - первая картинка цель правки, остальные доноры
• подмена персонажа с сохранением позы и одежды цели
• работает в ComfyUI без 17.5 ГБ энкодера
• 1024 по умолчанию, 30 шагов
• ~17.5 ГБ пиковый VRAM, меньше с cpu offload
Ограничения: только английский, цифры на вывесках пишет с ошибками, не-фото референсы переносятся хуже. Демо и workflow для ComfyUI прилагаются
HF
Текстовый энкодер 0.6B
ComfyUI
#t2i #i2i #compact
MAX


