Qwen-Image-2.0: Китайский ИИ для генерации картинок, который не боится длинных текстов и сложных задач
Команда Alibaba представила новое поколение своей модели для генерации и редактирования изображений — Qwen-Image-2.0. Модель заточена на работу со сложными инструкциями на естественном языке и обещает стать мощным инструментом для креативщиков.
Ключевые возможности:
• Обработка сверхдлинных промптов: Понимает инструкции длиной до 1000 токенов (примерно 700-900 слов).
• Следование сложным инструкциям: Справляется с многоэтапными задачами, требующими понимания структуры, последовательности действий и стиля.
• Улучшение работы с текстом: Рендерит текст в изображения, сохраняя читаемость даже в мелком шрифте и сложной композиции (хотя с поддержкой русского языка все также не очень).
• Редактирование изображений: Позволяет загружать одну или несколько картинок и изменять их по текстовому описанию (смена стиля, добавление элементов, коллажи).
• Высокое качество вывода: Генерирует изображения в разрешении до 2K.
📝 Технические детали
Модель демонстрирует прогресс в решении классической проблемы генеративных моделей — потери информации при рендеринге мелкого и плотного текста из-за сжатия в VAE (Variational Autoencoder). В Qwen-Image-2.0 были улучшены как компонент VAE, так и сама генеративная модель, что повысило чёткость и читаемость текста в таких сценариях, как инфографика или плакаты. Также разработчики сообщают об оптимизации размера модели для более быстрой генерации и низкого порога развёртывания.
chat.qwen.ai
#КитайскийИИ #КитайAI #Qwen #Alibaba
Post #217
2.21K