TGViewer
The Layer The Layer @layercv · 853 subscribers
Post #155 1.19K
A Noise is Worth Diffusion Guidance

Довольно любопытная работа.
В диффузионных моделях применяется механизм под названием Classifier Free Guidance (есть и другие вариации, но CFG — де-факто стандарт). Без него сгенерированные на основе текстового промпта изображения выглядят очень печально (см. картинки 1 и 4), потому что тогда модель не получает достаточный сигнал от условия и искажает структуру.

С CFG диффузию прогоняют два раза: один раз с условием, другой раз без, разница взвешенно добавляется к безусловному выводу.
Применение метода даёт невероятное улучшение качества, но проблема с ростом вычислительных затрат, которые и без того находятся за пределами добра и зла, всех очень беспокоит.

Есть различные способы от CFG избавиться, например, при обучении с дистилляцией (учитель - ученик), можно сразу обучать на результате с CFG. Так сделали в открытой версии нашумевшей модели FLUX.1-schnell.
Работает хорошо, но это дорого и больно.

В очередной попытке вопрос решить, авторы исходят из своего наблюдения: если инвертировать качественное изображение в изначальный шум (при помощи DDIM или других методов с детерминированным сэмплированием), то, затем, из этого шума получается хорошее изображение уже без всякого гайденса.

Выходит, что нужен просто правильный мёд шум. Его правильность, кстати, тоже исследуют и приходят к выводу, что разница с гауссовским, в общем-то, невелика и сводится к небольшим низкочастотным элементам.
Имея этот расклад, остаётся придумать, как отобразить одно пространство в другое.

Для этого используется всё та же диффузионная модель. Внимательный читатель может спросить — опять прогонять ещё одну модель? А мы не сделали круг?
Не сделали, поскольку используется LoRA с рангом 128 и оптимизируется она напрямую на конечных изображениях (оптимизация на шуме даёт результат хуже) и работает на этапе инференса в один шаг.

Результаты метода, названного Refined Noise, получаются, если верить статье и черри-пикам, хорошие, при этом не страдает ни разнообразие, ни способность модели к генерализации.

Более того, при Side-By-Side сравнении с CFG моделью, Refined Noise немного даже выигрывает.
По метрикам на бенчмарках чуть пониже оригинала, но сравниваются уже с пайплайном с СFG + PAG (Perturbed-Attention Guidance, ещё один гайденс для улучшения структуры). Т.е. разница в вычислительных затратах между методами уже не в 2, а в 3 раза.

К сожалению, в статье используется StableDiffusion 2.1, было бы интересно посмотреть на результат на более современных моделях.

Есть ещё один малозаметный нюанс. И для генерации обучающих данных и при сравнении всех моделей использовались CFG + PAG. Но, если верить подписям, в SBS, внезапно, сравнение проводилось против просто CFG модели, что противоречит собственной же аргументации:
We observe that some proportion of images generated with CFG [13] in Stable Diffusion 2.1 [36] exhibit low quality, often appearing blurry or displaying distorted facial features, eyes, and noses

To enhance the quality of samples, we apply PAG along with CFG, as PAG has been shown to reduce blurriness and improve anatomical structure effectively


Тем не менее, впечатляет гибкость метода и что им можно заменять сразу несколько гайденсов.
Код обещают выложить.
  • 🔥 8
  • ❤ 5
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →