🚀 DeepMind исправили одну из самых «грязных» проблем генерации изображений и решение оказалось удивительно простым
Любая diffusion-модель (Stable Diffusion, Flux и другие) работает через latent-пространство.
Сначала энкодер сжимает изображение, затем модель учится генерировать уже в этом компактном представлении.
Проблема, о которой почти не говорят:
Как обучать энкодер по сути, угадывание.
В классическом подходе (Stable Diffusion) используют KL-регуляризацию с ручным коэффициентом:
- слишком сильная - теряются детали
- слишком слабая — латенты становятся хаотичными
- итог — все просто подбирают число «на глаз»
Это как настраивать радио вслепую.
DeepMind переосмыслили задачу.
Вместо раздельного обучения они:
- обучают энкодер и diffusion-модель совместно
- связывают шум энкодера с минимальным уровнем шума в diffusion-процессе
- заменяют сложную KL-регуляризацию на понятную взвешенную MSE
Главное нововведение, теперь можно точно контролировать, сколько информации проходит через латенты.
Раньше:
сжали изображение → надеемся, что «примерно нормально»
Теперь: есть реальный «регулятор», который показывает информационный поток и позволяет задать его точно.
Результаты:
- FID 1.4 на ImageNet-512
- меньше вычислений, чем при обучении на латентах Stable Diffusion
- новый SOTA на видео (FVD 1.3 на Kinetics-600)
Но главное это не цифры.
Они убрали одну из самых эвристических частей генеративного пайплайна и сделали её принципиальной и управляемой.
И неприятный вывод для всех, кто строит системы на замороженных энкодерах Stable Diffusion:
Возможно, вы оптимизируете всё… кроме фундамента.
https://arxiv.org/abs/2602.17270
Post #1352
1.64K

- ❤ 6
- 👍 4
- 😘 3
- 👎 1