Про multi-concept generation
Кажется, качественной генерацией одиночных объектов сейчас никого не удивить. In-context модели справляются отлично почти с любыми объектами, а если нужно генерировать людей — выручают старые добрые адаптеры. Например, наша T-LoRA, которую мы в этом году представили на AAAI в Сингапуре 😌
Однако, возникает задачка со звездочкой: как сгенерировать сразу несколько разных кастомных сущностей на одной картинке?
Нередко в таких случаях возникает проблема «смешивания». Когда вместо двух отдельных, хорошо узнаваемых людей вы получаете двоих, усредненных между ними по внешности👯♀️.
По моему опыту, самым стабильно работающим методом (не требующим дообучения и позволяющим надежно отделить объекты) остается маскирование.
Концепт простой: находим внутри диффузионного процесса маски нужных объектов. Дальше используем принцип «разделяй и властвуй» — внутри маски №1 применяем адаптер №1, внутри маски №2 — адаптер №2 и так далее.
Отлично работает, например, в реализации LoRAShop.
Именно поэтому мы полностью обновили репозиторий T-LoRA и адаптеировали его для генерациии нескольких концептов!
Под капотом новой версии:
📌 PEFT-адаптеры — теперь всё работает как plug-and-play с любой моделью и пайплайном Diffusers. Можно загружать, переключать или комбинировать несколько T-LoRA прямо на этапе инференса.
📌 Интеграция с LoRAShop из коробки — генерация нескольких кастомных концептов, обученных независимо.
Там же небольшая пасхалка-пример с авторами статьи🤫
А к этому посту прикрепляю результат работы T-LoRA+LoRAShop: сгенерировали сущности российского культурного кода на модели Kandinsky. Здесь исторические и современные личности, архитектурные объекты, русская кухня, персонажи мультфильмов и многое другое.
Всех узнали?🙃
Post #21
267








