Меня зовут Андрей Кузнецов
Руковожу управлением в Sber AI, построил успешную лабораторию FusionBrain в AIRI, один из основателей Kandinsky, к.т.н., 15+ лет опыта в Computer Vision, выступаю с лекциями и пишу о событиях в AI и ML
Post #50
1.3K

🔥🔥🔥Команда Berkley на днях представила новую модель InstructPix2Pix, которая позволяет редактировать изображения в соответствии с текстовой инструкцией.
#простой_ai: авторы учат модель для управления изменениями на изображении через текстовые инструкции («добавь корабль на воду», «замени человека инопланетянином» и т.д.) - сначала учится одна модель для синтеза этих инструкций, а затем вторая - учится генерировать похожее изменённое в соответствии с инструкцией изображение.
Задача редактирования изображений решается в классическом supervised режиме:
1. На первом этапе создаётся датасет обсечения, который включает в себя текстовые инструкции, исходные и соответствующие изменённых изображений
2. На втором обучается диффузионная модель для редактирования изображений на этом синтезированном наборе данных
При этом обучение на синтетических данных (вопреки принятому мнению, что лучше учить на реальных чистых данных) не портит модель синтеза изображений.
Синтез инструкций выполняется посредством файнтюна модели GPT3 Davinci на 700 промтах из LAION-Aesthetics V2 6.5+ в течение одной эпохи. В результате на основе входного текстового описания синтезируется как сама текстовая инструкция для редактирования изображения, так и изменённое в соответствии с интукцией текстовое описание изображения. Затем два текстовых промта преобразуются в пару соответствующих изображений с помощью модели, основанной на StableDiffusion (по 100 сэмплов на каждую пару описаний). Для того, чтобы генерации по двум близким промтам не сильно отличались (что свойственно в обычном режиме генерации), авторы используют метод Prompt-to-Prompt, который позволяет увеличить сходство нескольких генераций диффузионной модели. Это делается с помощью переноса весов cross attention на некотором количестве шагов деноизинга.
Больше деталей можно как всегда найти в статье⬇️
📕 статья
🖥 GitHub
🏆HF demo - медленная:(
@complete_ai
#простой_ai: авторы учат модель для управления изменениями на изображении через текстовые инструкции («добавь корабль на воду», «замени человека инопланетянином» и т.д.) - сначала учится одна модель для синтеза этих инструкций, а затем вторая - учится генерировать похожее изменённое в соответствии с инструкцией изображение.
Задача редактирования изображений решается в классическом supervised режиме:
1. На первом этапе создаётся датасет обсечения, который включает в себя текстовые инструкции, исходные и соответствующие изменённых изображений
2. На втором обучается диффузионная модель для редактирования изображений на этом синтезированном наборе данных
При этом обучение на синтетических данных (вопреки принятому мнению, что лучше учить на реальных чистых данных) не портит модель синтеза изображений.
Синтез инструкций выполняется посредством файнтюна модели GPT3 Davinci на 700 промтах из LAION-Aesthetics V2 6.5+ в течение одной эпохи. В результате на основе входного текстового описания синтезируется как сама текстовая инструкция для редактирования изображения, так и изменённое в соответствии с интукцией текстовое описание изображения. Затем два текстовых промта преобразуются в пару соответствующих изображений с помощью модели, основанной на StableDiffusion (по 100 сэмплов на каждую пару описаний). Для того, чтобы генерации по двум близким промтам не сильно отличались (что свойственно в обычном режиме генерации), авторы используют метод Prompt-to-Prompt, который позволяет увеличить сходство нескольких генераций диффузионной модели. Это делается с помощью переноса весов cross attention на некотором количестве шагов деноизинга.
Больше деталей можно как всегда найти в статье⬇️
📕 статья
🖥 GitHub
🏆HF demo - медленная:(
@complete_ai
- 🔥 12
- 👍 2
- 🤗 1















