TGViewer
Awesome DL Awesome DL @awesome_dl · 870 subscribers
Post #81 1.12K
Новый взгляд на диффузии

В появившееся свободное время я наконец добрался до постов sander.ai (он занимается Veo 2 в Google DeepMind). И тут, бац, спустя столько времени, сильно изменилось моё понимание диффузии. Поэтому вот основные тейки, которые вы можете применять во всех сферах DL.

1️⃣ Главная фишка диффузии — это способность описывать очень сложное распределение. У классических моделей вроде GAN и VAE есть ограничения: они, по сути, работают с одним доменом и одними и теми же типами картинок. Диффузия же способна моделировать произвольное распределение. Если нужно описать что-то действительно сложное и многогранное, стоит обратить внимание именно на диффузию.

2️⃣ Диффузию и авторегрессия связаны! В эпоху мультимодальности существуют два подхода — диффузия и авторегрессия. Оба работают, и поэтому хочется их объединить. Видим, что есть диффузию для LLM и авторегрессивную генерацию изображений.

Пока что ни один из этих подходов не достигает SOTA (state of the art) на «чужом» домене. Причина в том, что у генерации текста и у генерации изображений разные функции ошибки:

- Авторегрессия максимизирует вероятность каждого пикселя, что даёт детализированные фрагменты, но общее изображение может выглядеть странно.
- Человек видит картинку целиком, а уж затем вглядывается в детали. Сначала воспринимаются «низкие частоты» — общий план, и только потом «высокие частоты» — мелкие детали.
- Диффузия, по сути, — это авторегрессия в пространстве частот: сначала формируется эскиз (низкие частоты), затем дорисовываются детали (высокие) с учётом эскиза.

Тут и есть пересечении, на которой могут развиваться оба подхода.

3️⃣ Trade-off между качеством и скоростью. Раньше я не понимал, зачем менять скорость генерации на качество. Но с точки зрения продукта это имеет смысл: меньше шагов диффузии — быстрее работа, больше шагов — лучше итоговое качество. Было бы здорово перенять подобную гибкость и для LLM; вполне возможно, что именно на таких компромиссах будет строиться более совершённый reasoning, когда за счёт политики на основе диффузии будет выбираться насколько подробным может быть ответ.

😎 Conclusion
Важно постоянно развиваться и узнавать новое, особенно в мире, где технологии меняются так быстро. Я уже обновил свою подборку по диффузиям, а в ближайшее время планирую добавить туда и материалы про видеомодели — следите за обновлениями!
  • 👍 10
  • ❤ 4
  • 🔥 1
More from @awesome_dl
  1. Jul 31, 2026Age of Autoresearch Был обычный вечер, и мне было откровенно лень гонять гипотезы руками.…
  2. Jul 22, 2026Слухи о том, как китайцы дистиллировали frontier и как claude стрельнул себе в ногу через…
  3. Jun 16, 2026Новая эра интерфейсов Мне давно хочется создавать системы, которые живут и адаптируются ка…
  4. May 13, 2026Krea-2: taste is what matters 4 месяца назад я перешёл в Krea и вчера мы выкатили модель K…
  5. Mar 31, 2026История о том, как штука для рисования треугольников стала самым важным чипом на планете М…
  6. Mar 15, 2026Когда мы получим realtime видео? Считаю от first principles (Лонгрид) Мне всегда было инте…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →