Вместо отдельных костылей для генерации, удаления фона и удержания персонажа — Alibaba выкатила в опенсорс Qwen-Image-2.1. Это унифицированная 7B DiT-модель, которая объединяет генерацию текста в картинку и точечное редактирование в одном пайплайне.
Главные фичи:
• Честный прозрачный фон (RGBA): генерирует стикеры, иконки и объекты сразу без фона. Больше не нужно гонять результат через сторонние сетки вроде rembg — модель нативно отдает прозрачный слой.
• До 10 референсных картинок: удерживает лицо и внешность человека при разных ракурсах, позволяет собирать групповые фото из отдельных портретов или точно переносить предметы в новый интерьер.
• Правки без сложных масок: можно указать зону правок текстовым промптом, обвести кружком или закрасить кистью.
• Оптимизация инференса: пайплайн работает через официальный Diffusers (
QwenImage21Pipeline) с поддержкой CPU offload и bfloat16.Веса и код уже выложены в открытый доступ:
🔵 Hugging Face (веса + демо)
🔵 Репозиторий на GitHub
GHOSTLY | AI 🌐 | ЧАТ 💬