TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 534 subscribers
Post #1333 189
Команда Qwen опубликовала веса Qwen-Image-2.1 — новой модели, которая объединяет генерацию изображений по тексту и редактирование уже существующих картинок. Непосредственно генеративная часть содержит 7 млрд параметров и состоит из 32 слоёв Single-Stream DiT, а для понимания текста и референсных изображений используется Qwen3-VL 8B. Модель нативно работает с разрешением до 2K.

Одна из главных особенностей Qwen-Image-2.1 — полноценная работа с прозрачностью. Модель умеет сразу генерировать изображения с альфа-каналом в RGBA, редактировать прозрачные изображения и извлекать отдельные объекты из обычных фотографий. То есть для создания стикеров, элементов интерфейса или товарных изображений больше не обязательно отдельно прогонять результат через модель удаления фона. За это отвечает специальный 64-канальный RGBA-VAE с 16-кратным пространственным сжатием.

Сильно расширились и возможности редактирования. В одном запросе можно использовать до десяти референсных изображений, например собрать общую фотографию из отдельных портретов или перенести на человека одежду и аксессуары с нескольких разных картинок. Нужную область можно указать обычным кружком или нарисованной пометкой либо передать отдельную маску. Qwen также отдельно улучшила сохранение внешности людей и вида товаров при изменении сцены. В демонстрациях модель превращает селфи в панораму, строит раскадровки по трём видам персонажа и одновременно меняет несколько отмеченных областей изображения.

В собственном Qwen-Image-Bench модель получила 60,28 балла, несмотря на сравнительно небольшую 7B генеративную часть. Сам бенчмарк создан Qwen совместно с художниками и оценивает качество, эстетику, соответствие промпту, реалистичность и творческие способности.

Весы уже доступны для локального запуска, а поддержку в день релиза получили Diffusers, ComfyUI, vLLM-Omni и SGLang. При этом есть существенное отличие от предыдущих релизов семейства: Qwen-Image-2.1 распространяется не под Apache 2.0, а под Qwen Research License. Она разрешает использование модели только для исследований и оценки; для коммерческого применения необходимо отдельно получить лицензию у Qwen. Поэтому корректнее говорить об открытых весах модели, а не о полностью свободной open-source модели.

🔗 Hugging Face | GitHub | Демо
  • 🔥 1
More from @synaptic_garden
  1. Sep 22, 2026Яндекс выложил в опенсорс AliceAI-Foundation-80B-A3B-Base: базовую модель, обученную с нул…
  2. Sep 22, 2026photo post
  3. Sep 22, 2026Xiaomi выпустила семейство MiMo-V2.6 из двух моделей: флагманской MiMo-V2.6-Pro и более де…
  4. Sep 21, 2026SpaceXAI представила Grok 4.7 — флагманскую модель, ориентированную на задачи программиров…
  5. Sep 21, 2026Появился сайт, на котором приведены ссылки на множество примеров использования Jev: https:…
  6. Sep 20, 2026PrismML ужала Qwen3.8 27B до 5,9 ГБ с трёхзначными весами PrismML выпустила Ternary Bonsai…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →