Google Research попыталась объяснить, откуда у diffusion-моделей берётся «креативность».
Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?
Ответ оказался математическим.
Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.
Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.
Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.
В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.
То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.
Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.
Работа представлена на ICLR 2026, код экспериментов опубликован открыто.
https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/
Post #2356
3.64K

- 👍 6
- 👎 2
- ❤ 1
- 🔥 1
- 🤔 1