TGViewer
AI Brain (Aibek Alanov) AI Brain (Aibek Alanov) @aibrain_channel · 1.07K subscribers
Post #34 2.29K
Как ускорить обучение диффузионных моделей с помощью self-supervised признаков

Известно, что в процессе обучения диффузионки выучивают внутренние семантические представления объектов. Это логично, ведь чтобы сгенерировать объекты, модель должна «понимать» их семантику.

Однако существует целое направление машинного обучения — self-supervised learning (SSL), цель которого как раз заключается в обучении энкодеров, эффективно выделяющих семантические признаки объектов без необходимости генерации. Интересно понять, насколько представления, получаемые диффузионками, уступают или превосходят признаки, полученные self-supervised подходами.

В этой статье авторы выяснили, что семантические признаки, формируемые диффузионками, менее информативны по сравнению с признаками из self-supervised энкодеров, и хуже подходят для решения негенеративных задач, например, для классификации, сегментации и тд. Предположительно это связано с тем, что диффузионки вынуждены хранить много дополнительной, высокочастотной информации, необходимой для генерации деталей изображения.

Исходя из этого наблюдения, авторы предложили простое решение: добавить регуляризацию в виде косинусного расстояния между представлениями диффузионной модели и предобученного self-supervised энкодера. Эта идея сработала отлично — обучение диффузионки ускорилось на порядок, и качество генерации заметно улучшилось.

В исследовании подробно рассмотрели различные конфигурации: разные размеры и типы self-supervised энкодеров, разные представления диффузионок (выходы с разных слоев) и т.д. Результаты убедительно подтверждают эффективность предложенного подхода.

Мне статья понравилась своей простотой и убедительными экспериментами. Сразу возникают куча новых вопросов: Чем принципиально отличаются внутренние представления диффузионок и SSL-энкодеров? Можно ли напрямую использовать SSL-лоссы вместо предобученных энкодеров? Какие представления и на каких этапах должны формироваться диффузионками? Обилие таких вопросов подчеркивает важность и перспективность предложенного подхода.

Статья, гитхаб
  • 👍 24
  • ❤ 6
  • 🔥 3
  • 🌚 2
More from @aibrain_channel
  1. Nov 21, 2025Сегодня выступил на конфе AIJ 2025. Рассказал про наши исследования по генеративкам 😎
  2. Oct 14, 2025Набор студентов на наши исследовательские проекты 🎓 Октябрь - время выбирать темы курсовы…
  3. Sep 15, 2025Подробнее о генеративных моделях для изображений — в новом Хабре⤵️ Нейросети для генерации…
  4. Jun 10, 2025Пишу про нашу новую работу, которую мы недавно засабмитили на NeurIPS. В нашей статье Imag…
  5. Jun 6, 2025Сегодня выступаю на True Tech Day. Рассказываю про современные генеративки и как они устро…
  6. Jun 6, 2025Post #36
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →