TGViewer
Neural Shit Neural Shit @neuralshit · 53.7K subscribers
Post #7720 6.8K

Forwarded from Метаверсище и ИИще

Алибабищенко бахнул Qwen-Image 2.1 и выложил веса.

Это единая модель для генерации и редактирования изображений. Визуальная часть содержит 7B параметров и 32 Single-Stream DiT-блока. Сносно.

Ништяки:

- native 2K - базовое разрешение 2048x2048, поддерживаются в том числе 2752x1536 и 1536x2752;
- text-to-image и image editing в одной модели;
- до 10 референсных изображений одновременно;
- локальное редактирование можно задавать каракулями, нарисованными пометками или отдельными масками;
- улучшено сохранение идентичности людей и объектов при редактировании;
- улучшены типографика, портретное освещение, текстуры и мелкие детали;
- рекомендуемый стандартный режим - 40 inference steps.

Одна из самых интересных фишек - нативный RGBA и прозрачность. Модель умеет сразу генерировать объект с alpha-каналом(!), редактировать прозрачные изображения(хм) и даже типа взять обычную RGB-фотографию и извлечь из неё нужный объект в отдельный прозрачный RGBA-слой (верим? тестируем?).

Веса уже доступны на Hugging Face. Comfy Org также выложила набор весов Qwen-Image 2.1 для ComfyUI, а сама Comfy ещё до релиза заявляла нульдэй саппорт.

Лицензия - говно. Ресерч.

На рыддите, кто-то рыдает от восторга, особенно от эдит и консистентности, а кто-то ноет про кожу и мыло. Кожаным не угодишь. Жду тестов в коментах

Шопопамяти:

Хорошая новость: 24-32 GB VRAM для неё, похоже, вообще не обязательны.

На Reddit уже пишут, что модель должна нормально жить даже на RTX 3060 при квантизации.

Сама 7B-модель в INT8 около 7 GB + text encoder Qwen3-VL в W4A8 около 6 GB.

То есть суммарно порядка 13 GB весов, причём ComfyUI умеет выгружать части в RAM, поэтому 12 GB VRAM выглядит вполне нарядным вариантом.

Для нищебродов:
8 GB VRAM - скорее всего заведётся с агрессивной квантизацией/offload, но пока нет нормальных подтверждённых тестов именно Qwen-Image 2.1.
12 GB VRAM - выглядит как реальный рабочий минимум для квантованной версии в ComfyUI.

Для помещиков:
16 GB VRAM - сейчас выглядит как очень нормальный вариант. На Reddit владельцы 5060 Ti 16 GB уже радуюццо релизу именно в этом контексте.
24 GB VRAM - должно быть уже совсем комфортно для квантованной модели и, вероятно, позволит меньше гонять данные CPU<->GPU.

Для Баяр:
32 GB - может влезут и не кванты..

Почему такая разница с прежним Qwen Image: старая модель была огромной - около 20B параметров только генеративной части, а Qwen-Image 2.1 теперь жалкие 7B.

Ссылки:

Официальная страница Qwen:
qwen.ai/blog?id=qwen-image-2.1

Веса Qwen-Image 2.1:
huggingface.co/Qwen/Qwen-Image-2.1

Версия для ComfyUI:
huggingface.co/Comfy-Org/Qwen-Image-2.1

@cgevent
More from @neuralshit
  1. Sep 20, 2026просто оставлю это здесь взял отсюда
  2. Sep 19, 2026AGI
  3. Sep 18, 2026Post #7718
  4. Sep 18, 2026Наткнулся на прикольдую демку, где можно посмотреть, как выглядел бы мир, если бы скорость…
  5. Sep 18, 2026Это нам всем за то, что усердно молились
  6. Sep 17, 2026Typesafe: pnewed 💨 Jev: liberated 🫡 Я обучил MLP поверх qwen 4b и оно работает буквально…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →