TGViewer
Метаверсище и ИИще Метаверсище и ИИще @cgevent · 52.4K subscribers
Post #16704 11.1K
Алибабищенко бахнул Qwen-Image 2.1 и выложил веса.

Это единая модель для генерации и редактирования изображений. Визуальная часть содержит 7B параметров и 32 Single-Stream DiT-блока. Сносно.

Ништяки:

- native 2K - базовое разрешение 2048x2048, поддерживаются в том числе 2752x1536 и 1536x2752;
- text-to-image и image editing в одной модели;
- до 10 референсных изображений одновременно;
- локальное редактирование можно задавать каракулями, нарисованными пометками или отдельными масками;
- улучшено сохранение идентичности людей и объектов при редактировании;
- улучшены типографика, портретное освещение, текстуры и мелкие детали;
- рекомендуемый стандартный режим - 40 inference steps.

Одна из самых интересных фишек - нативный RGBA и прозрачность. Модель умеет сразу генерировать объект с alpha-каналом(!), редактировать прозрачные изображения(хм) и даже типа взять обычную RGB-фотографию и извлечь из неё нужный объект в отдельный прозрачный RGBA-слой (верим? тестируем?).

Веса уже доступны на Hugging Face. Comfy Org также выложила набор весов Qwen-Image 2.1 для ComfyUI, а сама Comfy ещё до релиза заявляла нульдэй саппорт.

Лицензия - говно. Ресерч.

На рыддите, кто-то рыдает от восторга, особенно от эдит и консистентности, а кто-то ноет про кожу и мыло. Кожаным не угодишь. Жду тестов в коментах

Шопопамяти:

Хорошая новость: 24-32 GB VRAM для неё, похоже, вообще не обязательны.

На Reddit уже пишут, что модель должна нормально жить даже на RTX 3060 при квантизации.

Сама 7B-модель в INT8 около 7 GB + text encoder Qwen3-VL в W4A8 около 6 GB.

То есть суммарно порядка 13 GB весов, причём ComfyUI умеет выгружать части в RAM, поэтому 12 GB VRAM выглядит вполне нарядным вариантом.

Для нищебродов:
8 GB VRAM - скорее всего заведётся с агрессивной квантизацией/offload, но пока нет нормальных подтверждённых тестов именно Qwen-Image 2.1.
12 GB VRAM - выглядит как реальный рабочий минимум для квантованной версии в ComfyUI.

Для помещиков:
16 GB VRAM - сейчас выглядит как очень нормальный вариант. На Reddit владельцы 5060 Ti 16 GB уже радуюццо релизу именно в этом контексте.
24 GB VRAM - должно быть уже совсем комфортно для квантованной модели и, вероятно, позволит меньше гонять данные CPU<->GPU.

Для Баяр:
32 GB - может влезут и не кванты..

Почему такая разница с прежним Qwen Image: старая модель была огромной - около 20B параметров только генеративной части, а Qwen-Image 2.1 теперь жалкие 7B.

Ссылки:

Официальная страница Qwen:
qwen.ai/blog?id=qwen-image-2.1

Веса Qwen-Image 2.1:
huggingface.co/Qwen/Qwen-Image-2.1

Версия для ComfyUI:
huggingface.co/Comfy-Org/Qwen-Image-2.1

@cgevent
  • 🔥 31
  • ❤ 7
  • 👍 2
More from @cgevent
  1. Sep 20, 2026Post #16714
  2. Sep 20, 2026Релиз Qwen Image 2.1 в 16.00 Это единая редактирующая модель. Поддержка в Комфи сразу на р…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →