🤓🤓🤓🤓🤓🤓🤓🤓
🤓 Сегодня в рубрике #разбираемся_в_понятиях — технология, стоящая за большинством современных генераторов изображений.
Вы пишете текстовый запрос, и через пару мгновений перед вами появляется готовая картинка. Интуитивно кажется, будто нейросеть «рисует» её с нуля, постепенно добавляя детали. На деле всё ровно наоборот: она движется от хаоса к структуре.
🧑🏻💻 Во время обучения модель берёт реальные изображения и методично их разрушает. Она добавляет шум (случайные искажения) снова и снова, пока от исходной картинки не остаётся бессмысленный набор пикселей. Параллельно она запоминает, как выглядел каждый шаг разрушения.
Когда этот навык доведён до совершенства, процесс запускают в обратную сторону: модель начинает шаг за шагом вычитать шум, пока из «пиксельной каши» не проявится осмысленное изображение.
🎯 Такой подход выбран не случайно. Прямая генерация «с нуля» — невероятно сложная задача: модели пришлось бы сразу создавать готовое изображение, не имея промежуточных ориентиров. Диффузионные модели идут другим путём: они разбивают задачу на множество маленьких этапов.
🤔 Но возникает вопрос: как модель понимает, что именно должно проявиться?
Здесь в игру вступает ваш промпт. Он кодируется в числовой вектор и на каждом этапе очистки «подсказывает» модели, в каком направлении двигаться. Именно благодаря этому «закат над морем» и «портрет в стиле Ван Гога» при одинаковой механике дают совершенно разный результат.
💫 Диффузионные модели перевернули представление о том, как машина может «творить». Это уже не подбор похожих образов из базы данных, а создание структуры заново — из чистой случайности, направляемой заданным смыслом.
🅱️ Интеграл в VK | 📤 Интеграл в MAX
Post #5051
155

- ❤ 5
- 👍 1