Процесс генерации представляет собой преобразование из некоего исходного распределения (например, Гауссианы) в целевое распределение данных. На языке умных это называется pushforward (толкайвперед). И задача генеративного моделирования найти хороший толкайвперед.
Обновление параметров нейронной сети соответствует дрейфу сэмплов. И задача найти такое дрейфовое поле V, такое что когда моделируемое распределение равно целевому, дрейфа нет.
И одним из возможных решений является антисимметричное дрейфовое поле.
Итеративный процесс имеет вид:
f_{t+1} = f_{t} + V(f)
И лосс функция
L = || f_{t} - stopgrad(f_{t} - V(f)) ||
Т.е зануление поля.
В качестве поля выбирают некое выражение, содержащее ядро, и представляющее собой разность двух членов:
➕ Положительного поля - сэмплов из целевого распределения
➖ Отрицательного поля - синтетических сэмплов
В идеале, когда оба поля совпадают - V = 0, и синтетическое распределение равно целевому.
Важным оказывается считать ядро не в исходном пространстве (латентном или пиксельном), а в пространстве признаков некой модели - SimCLR, MoCo, MAE.
Кроме того, метод из коробки поддерживает гайденс с отталкиванием от unconditional распределения.
🧪 Эксперименты
Метод валидируют сначала на игрушечных датасетах, а затем на Имадженете 256x256.
Показывают, что лосс хорошо коррелирует с визуальным качеством.
На имадженете ставят новый рекорд по FID (1.54) при одношаговой генерации (обходя iMeanFlow-XL). При этом их модель меньше - 475М параметров против 610M у iMeanFlow-XL.
В ablation демонстируют, что:
▶️ Важно брать достаточно много сэмплов для оценки распределения в ядре. Причем брать положительных примеров столько же сколько и отрицательных.
▶️ Важно считать поле в пространстве эмбеддингов какой-то модели иначе не работает. Лучше всего себя показывает диффузия в пространстве MAE, работающем в латентном пространстве и дообученном на классификацию.
▶️ Антисимметрия важна, иначе заметно хуже.
Работает хорошо как в пиксельном, так и латентном пространстве.
Кроме того, еще тестируют свой подход в приложениях к роботехнике 🤖.
💡 Выводы
Выглядит довольно интересно и инновационно. Интересно, воспроизведется ли хорошее качество одношаговой генерации на t2i задачах, эдитинге изображений и других более сложных задачах.