Простыми словами. Как работают нейросети для создания картинок
Решил попробовать рубрику "простыми словами". Первый пост из этой серии будет посвящен нейросетям для генерации картинок. Среди популярных решений — Midjourney, DALL-E и Stable Diffusion.
В основе этих удивительных инструментов лежат диффузионные модели. Они позволяют постепенно превращать случайное зашумлённое изображение в красивую картинку.
Почему всё происходит поэтапно?
Представьте себе, что на столе перед вами оказывается куча перемешанных деталей LEGO, и вам поручено построить дворец в течение, скажем, 10 дней. А теперь представьте, что каждый день ваша работа оценивается и выставляется оценка за промежуточный результат. И на 10-ый день вы сдаёте готовое творение. Результат должен получиться лучше, чем если бы вас оценивали только в самом конце, верно? Так и есть. Существуют и другие подходы, где нейросеть проверяется только по итогам работы, однако они оказываются менее эффективными.
Откуда берётся разнообразие?
Разнообразие достигается благодаря тому, что нейросеть принимает на вход случайный шум. Даже если запрос "заказчика" остаётся одинаковым, на выходе получаются разные картинки. Это напоминает ситуацию, когда вам каждый раз предоставляют совершенно другой набор деталей LEGO, из которых можно собрать какой-то уникальный дворец.
Как обучают нейросеть?
Для обучения используются тысячи картинок, каждая из которых имеет текстовое описание. И тут происходит обратный процесс — картинку поэтапно покрывают шумом. И просят нейросеть восстановить исходное изображение. Это если бы взяли собранный из LEGO дворец и ломали его постепенно. А вам надо было бы его учиться восстанавливать. Конечно, учиться проще, если он разобран не полностью, а частично.
Как вам такое объяснение? Если зашло, не стесняемся, ставим реакцию 💥
Подробнее
Post #39
58