TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #644 2K
🔬 Метод

Процесс генерации представляет собой преобразование из некоего исходного распределения (например, Гауссианы) в целевое распределение данных. На языке умных это называется pushforward (толкайвперед). И задача генеративного моделирования найти хороший толкайвперед.

Обновление параметров нейронной сети соответствует дрейфу сэмплов. И задача найти такое дрейфовое поле V, такое что когда моделируемое распределение равно целевому, дрейфа нет.

И одним из возможных решений является антисимметричное дрейфовое поле.

Итеративный процесс имеет вид:
f_{t+1} = f_{t} + V(f)

И лосс функция
L = || f_{t} - stopgrad(f_{t} - V(f)) ||

Т.е зануление поля.

В качестве поля выбирают некое выражение, содержащее ядро, и представляющее собой разность двух членов:
➕ Положительного поля - сэмплов из целевого распределения
➖ Отрицательного поля - синтетических сэмплов
В идеале, когда оба поля совпадают - V = 0, и синтетическое распределение равно целевому.

Важным оказывается считать ядро не в исходном пространстве (латентном или пиксельном), а в пространстве признаков некой модели - SimCLR, MoCo, MAE.

Кроме того, метод из коробки поддерживает гайденс с отталкиванием от unconditional распределения.

🧪 Эксперименты

Метод валидируют сначала на игрушечных датасетах, а затем на Имадженете 256x256.

Показывают, что лосс хорошо коррелирует с визуальным качеством.

На имадженете ставят новый рекорд по FID (1.54) при одношаговой генерации (обходя iMeanFlow-XL). При этом их модель меньше - 475М параметров против 610M у iMeanFlow-XL.

В ablation демонстируют, что:
▶️ Важно брать достаточно много сэмплов для оценки распределения в ядре. Причем брать положительных примеров столько же сколько и отрицательных.
▶️ Важно считать поле в пространстве эмбеддингов какой-то модели иначе не работает. Лучше всего себя показывает диффузия в пространстве MAE, работающем в латентном пространстве и дообученном на классификацию.
▶️ Антисимметрия важна, иначе заметно хуже.

Работает хорошо как в пиксельном, так и латентном пространстве.

Кроме того, еще тестируют свой подход в приложениях к роботехнике 🤖.

💡 Выводы

Выглядит довольно интересно и инновационно. Интересно, воспроизведется ли хорошее качество одношаговой генерации на t2i задачах, эдитинге изображений и других более сложных задачах.
  • 🤔 4
  • ❤ 3
  • 👍 3
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →