⚡️🤖 Qwen-Image-2.1: модель для генерации изображений
Открытая Qwen-Image-2.1 предназначена для генерации и редактирования изображений. Модель объединяет text-to-image и image editing, поддерживает до 10 референсных изображений, локальную правку по маскам и пометкам, а также умеет сразу создавать изображения с прозрачным RGBA-фоном. Генеративная часть содержит 7 млрд параметров и 32 Single-Stream DiT-блока.
Для неё уже появился ускоритель Qwen-Image-2.1-viggle-turbo v0.2.1. Он сокращает обработку с 40 до 6 шагов и, по данным разработчиков, ускоряет генерацию примерно в пять раз. Turbo работает как с обычной генерацией, так и с редактированием по 1–3 референсным изображениям.
🔻 Главное изменение – появление квантованных GGUF- и NVFP4-версий.
Для генеративной части Qwen-Image-2.1 уже доступны облегчённые варианты:
– Q5_K_M — около 5,0 ГБ;
– Q4_K_M — около 4,2 ГБ;
– Q4_K_S — около 4,1 ГБ;
– Q3_K_M — около 3,2 ГБ.
📌 Для видеокарт с 8 ГБ VRAM одним из наиболее интересных вариантов является Q4_K_M.
Готовая версия от Unsloth занимает около 4,2 ГБ:
Qwen-Image-2.1 Q4_K_M – Unsloth
Есть и практически готовый комплект от gguf-org:
– DiT NVFP4 — около 4,05 ГБ;
– Qwen3-VL Q4_K_M — 5,03 ГБ;
– VAE — около 0,68 ГБ;
– готовые схемы для генерации и редактирования в ComfyUI.
Qwen-Image-2.1 GGUF / NVFP4 – gguf-org
Важно, что все эти компоненты не должны одновременно помещаться в видеопамять. ComfyUI может последовательно загружать генеративную часть, текстовый энкодер и VAE в VRAM и выгружать неиспользуемые компоненты обратно в оперативную память. Поэтому суммарный размер файлов может значительно превышать объём памяти видеокарты.
Для текстового энкодера также уже доступны облегчённые версии: например, Q4_K_M занимает 5,03 ГБ, тогда как более тяжёлые варианты требуют заметно больше памяти.
🔻 На практике это означает, что 8 ГБ VRAM уже достаточно для локального запуска Qwen-Image-2.1 при использовании квантованных весов и выгрузки компонентов в RAM.
Более того, существуют экспериментальные сборки, которые запускаются на RTX 4050 Laptop с 6 ГБ VRAM, поэтому 8 ГБ уже готовый класс оборудования для локальной работы. Для систем желательно иметь 24–32 ГБ оперативной памяти, поскольку именно туда выгружаются компоненты, которые в данный момент не используются видеокартой.
🔵 Таким образом, для Qwen-Image-2.1 уже не требуется обязательная видеокарта с 16–24 ГБ VRAM. Благодаря Q4_K_M, NVFP4 и другим квантованным версиям модель становится доступна владельцам массовых видеокарт с 8 ГБ памяти, а Turbo-режим дополнительно сокращает время генерации за счёт перехода с 40 до 6 шагов.
Post #1942
144
