Буквально на днях вышла достаточно занимательная работа от ребят из Австралии, в которой предлагается новый вариант guided генерации изображений на основе наброска (как doodles в GauGAN и др.) и текстовых описаний областей в дополнение к текстовому промту. Таким образом генерация превращается в задачу оптимизации с ограничениями. Ключевые поинты:
• в рамках задачи оптимизации одновременно оцениваются близость генерируемого изображения и наброска в соответствии с заданной функцией «рисования» и близость генерируемого изображения какому-либо изображению из подпространства картинок conditioned on text • задача оптимизации решается в латентном пространстве • использование diffusion based inversion подхода позволяет добавить детали в локальных областях • лэйблы сегментов наброска превращаются в отдельные соответствующие токены с помощью CLIP и добавляются к токенам текстового промта • в ходе обратной диффузии добавляется специальный cross-attention на лэйблы, что позволяет повышать качество в сегментах без дополнительного файнтюна • в отличие от SDEdit и Loopback результат выглядит как отличный tradeoff по меркам FID и L2 (численно подтверждается) • результаты генерации одновременно близки наброску и в то же время насыщены деталями в каждой локальной области этого наброскаИтог: сохранение структуры наброска + точное семантическое попадание и никаких дополнительных тюнов
Ждём скорого выхода демо - буду держать в курсе😉
Схема решения и примеры в комментариях ⬇️
📘статья
🖥 гитхаб+демо (coming soon!)
@complete_ai