⚡️ Очень понятная и сильная идея в этой работе
Авторы берут замороженные DINOv2 / SigLIP и превращают их в генеративную модель через Feature Auto-Encoder (FAE) - всего с одним attention-слоем.
Главная мысль:
👉 не пытаться сразу генерировать пиксели.
Сначала модель учится восстанавливать признаки teacher-модели, а уже потом отдельный декодер превращает их в изображение.
Как это делают:
- из изображения получают признаки DINOv2 / SigLIP
- сжимают их в очень маленький латент (всего 32 измерения)
- обучают модель восстанавливать эти признаки, сохраняя их семантику
- только после этого включают пиксельный декодер
Зачем это нужно:
Так 32-мерный латент сохраняет смысл изображения, а не просто пиксельную статистику.
Два ключевых трюка:
1️⃣ Gaussian Embedding Decoder
Пиксельный декодер заранее учат на признаках с добавленным шумом.
Это делает генерацию устойчивой и не даёт модели «развалиться» при обучении.
2️⃣ Time Shift
Смещение по времени в flow-matching помогает согласовать маленький латент и большое пространство изображений, ускоряя сходимость.
Результат:
- FID 1.29 на ImageNet-256
- обучение в 10 раз быстрее обычных подходов
(80 эпох вместо 800)
Вывод:
Можно получить топовое качество генерации, если сначала научить модель думать в признаках, а не сразу рисовать пиксели.
https://huggingface.co/papers/2512.07829
Post #967
3.53K

- 👍 6
- ❤ 4
- 🔥 1