Алибабищенко бахнул Qwen-Image 2.1 и выложил веса.
Это единая модель для генерации и редактирования изображений. Визуальная часть содержит 7B параметров и 32 Single-Stream DiT-блока. Сносно.
Ништяки:
- native 2K - базовое разрешение 2048x2048, поддерживаются в том числе 2752x1536 и 1536x2752;
- text-to-image и image editing в одной модели;
- до 10 референсных изображений одновременно;
- локальное редактирование можно задавать каракулями, нарисованными пометками или отдельными масками;
- улучшено сохранение идентичности людей и объектов при редактировании;
- улучшены типографика, портретное освещение, текстуры и мелкие детали;
- рекомендуемый стандартный режим - 40 inference steps.
Одна из самых интересных фишек - нативный RGBA и прозрачность. Модель умеет сразу генерировать объект с alpha-каналом(!), редактировать прозрачные изображения(хм) и даже типа взять обычную RGB-фотографию и извлечь из неё нужный объект в отдельный прозрачный RGBA-слой (верим? тестируем?).
Веса уже доступны на Hugging Face. Comfy Org также выложила набор весов Qwen-Image 2.1 для ComfyUI, а сама Comfy ещё до релиза заявляла нульдэй саппорт.
Лицензия - говно. Ресерч.
На рыддите, кто-то рыдает от восторга, особенно от эдит и консистентности, а кто-то ноет про кожу и мыло. Кожаным не угодишь. Жду тестов в коментах
Шопопамяти:
Хорошая новость: 24-32 GB VRAM для неё, похоже, вообще не обязательны.
На Reddit уже пишут, что модель должна нормально жить даже на RTX 3060 при квантизации.
Сама 7B-модель в INT8 около 7 GB + text encoder Qwen3-VL в W4A8 около 6 GB.
То есть суммарно порядка 13 GB весов, причём ComfyUI умеет выгружать части в RAM, поэтому 12 GB VRAM выглядит вполне нарядным вариантом.
Для нищебродов:
8 GB VRAM - скорее всего заведётся с агрессивной квантизацией/offload, но пока нет нормальных подтверждённых тестов именно Qwen-Image 2.1.
12 GB VRAM - выглядит как реальный рабочий минимум для квантованной версии в ComfyUI.
Для помещиков:
16 GB VRAM - сейчас выглядит как очень нормальный вариант. На Reddit владельцы 5060 Ti 16 GB уже радуюццо релизу именно в этом контексте.
24 GB VRAM - должно быть уже совсем комфортно для квантованной модели и, вероятно, позволит меньше гонять данные CPU<->GPU.
Для Баяр:
32 GB - может влезут и не кванты..
Почему такая разница с прежним Qwen Image: старая модель была огромной - около 20B параметров только генеративной части, а Qwen-Image 2.1 теперь жалкие 7B.
Ссылки:
Официальная страница Qwen:
qwen.ai/blog?id=qwen-image-2.1
Веса Qwen-Image 2.1:
huggingface.co/Qwen/Qwen-Image-2.1
Версия для ComfyUI:
huggingface.co/Comfy-Org/Qwen-Image-2.1
@cgevent
Post #16704
11.1K










- 🔥 31
- ❤ 7
- 👍 2