Команда Qwen опубликовала веса Qwen-Image-2.1 — новой модели, которая объединяет генерацию изображений по тексту и редактирование уже существующих картинок. Непосредственно генеративная часть содержит 7 млрд параметров и состоит из 32 слоёв Single-Stream DiT, а для понимания текста и референсных изображений используется Qwen3-VL 8B. Модель нативно работает с разрешением до 2K.
Одна из главных особенностей Qwen-Image-2.1 — полноценная работа с прозрачностью. Модель умеет сразу генерировать изображения с альфа-каналом в RGBA, редактировать прозрачные изображения и извлекать отдельные объекты из обычных фотографий. То есть для создания стикеров, элементов интерфейса или товарных изображений больше не обязательно отдельно прогонять результат через модель удаления фона. За это отвечает специальный 64-канальный RGBA-VAE с 16-кратным пространственным сжатием.
Сильно расширились и возможности редактирования. В одном запросе можно использовать до десяти референсных изображений, например собрать общую фотографию из отдельных портретов или перенести на человека одежду и аксессуары с нескольких разных картинок. Нужную область можно указать обычным кружком или нарисованной пометкой либо передать отдельную маску. Qwen также отдельно улучшила сохранение внешности людей и вида товаров при изменении сцены. В демонстрациях модель превращает селфи в панораму, строит раскадровки по трём видам персонажа и одновременно меняет несколько отмеченных областей изображения.
В собственном Qwen-Image-Bench модель получила 60,28 балла, несмотря на сравнительно небольшую 7B генеративную часть. Сам бенчмарк создан Qwen совместно с художниками и оценивает качество, эстетику, соответствие промпту, реалистичность и творческие способности.
Весы уже доступны для локального запуска, а поддержку в день релиза получили Diffusers, ComfyUI, vLLM-Omni и SGLang. При этом есть существенное отличие от предыдущих релизов семейства: Qwen-Image-2.1 распространяется не под Apache 2.0, а под Qwen Research License. Она разрешает использование модели только для исследований и оценки; для коммерческого применения необходимо отдельно получить лицензию у Qwen. Поэтому корректнее говорить об открытых весах модели, а не о полностью свободной open-source модели.
🔗 Hugging Face | GitHub | Демо
Post #1333
189

- 🔥 1