Канал ML-команды ОК. 12 лет делаем крутые вещи и делимся ими здесь
Контакты: @anokhinn
Post #84
802

Вышла статья Adversarial Diffusion Distillation, в которой представили быструю версию SDXL (без refiner-stage). Добились этого за счёт симбиоза дистилляции и GAN-подхода.
Дистилляция:
1. Ученик (идентичен учителю по архитектуре и изначальным весам) выполняет стандартный для диффузии процесс предсказания. Но при этом выбирает один из четырёх доступных шагов.
2. Аналогичное выполняет учитель, но располагает обычным диапазоном шагов — от 0 до 1000.
3. Разница (distillation loss) между шагом 2 и 3 считается с помощью L2 Loss.
Для улучшения результатов дополнительно применяется adversarial loss. Он считается благодаря сети, задача которой классифицировать сгенерировано на два класса: fake/real (аналогично GAN-подходам). Классификация применяется поверх признаков полученных с помощью DINOv2 (ViT-S).
В рамках наших экспериментов такая версия SDXL генерирует новое изображение за 200-340 мс (1-4 шага генерации) и при этом занимает 9 GB VRAM.
Дистилляция:
1. Ученик (идентичен учителю по архитектуре и изначальным весам) выполняет стандартный для диффузии процесс предсказания. Но при этом выбирает один из четырёх доступных шагов.
2. Аналогичное выполняет учитель, но располагает обычным диапазоном шагов — от 0 до 1000.
3. Разница (distillation loss) между шагом 2 и 3 считается с помощью L2 Loss.
Для улучшения результатов дополнительно применяется adversarial loss. Он считается благодаря сети, задача которой классифицировать сгенерировано на два класса: fake/real (аналогично GAN-подходам). Классификация применяется поверх признаков полученных с помощью DINOv2 (ViT-S).
В рамках наших экспериментов такая версия SDXL генерирует новое изображение за 200-340 мс (1-4 шага генерации) и при этом занимает 9 GB VRAM.
- 🆒 3
- 🔥 2








