Про SDXL
Новая модель от stability.ai (контора, которая разрабатывает stable diffusion), картинки от которой выглядят очень даже.
Прервемся на секунду. С моделями версий 1.x и 2.x у нас есть проблема - мы не можем генерировать большие изображения. Если попробуем сгенерировать картинку, с размерами сильно отличающимися от стандартных (512x512), то с высокой долей вероятности получим различные искажения и артефакты в виде дублирующихся головы/тела, повторяющегося фона и тому подобное. Это проблему решает hiresfix и работает он следующим образом:
1. Генерируем исходную картинку в txt2img, например 512x512
2. Прогоняем ее через апскейлер, чтобы просто увеличить картинку до нужного размера, например 1024x1024
3. Заапскейленую картинку прогоняем через img2img, чтобы добавить деталей
Как я понял, парни тоже самое решили сделать на уровне модели, точнее двух. Внутри SDXL у нас есть базовая модель (base) и дорабатывающая (хз как перевести, refiner). Первая генерирует картинку, вторая ее дорабатывает - процесс получается почти такой же как при уже знакомом нам hiresfix, с тем отличием, что вместо того чтобы создавать маленькую картинку и потом ее апскейлить, первая модель сразу создает изображение нужного размера, но не доделывает до конца, а оставляет чутка сыроватой и передает второй модели, которая уже доделает как надо. На выходе имеем красивую, большую картиночку. Поэтому новая модель (которая состоит из двух) и называется SDXL.
Но если играть, то по крупному, да? В моделях первой версии для обработки текста использовали openai'евский CLIP, во второй линейке OpenCLIP, а в SDXL решили использовать сразу оба и как говорят, промптится проще - результаты лучше, примерно как у Midjourney.
В итоге если в моделях первых версий было около 1млрд параметров, то с SDXL это около 6.6млрд. Это с одной стороны хорошо: больше параметров - лучше результат, больше разрешение, но и считать теперь сильно больше, и по идее нужно видеокарту помощнее, хотя ребята говорят, что все не так уж и плохо.
Кроме того, как пишет Эмад:
- готова поддержка Автоматика и ComfyUI
- уже готов Controlnet и t2i-адаптеры
- kohya обновил скрипты для тренировки и еще сделали какой-то свой тренер
- SDXL 1.0 будет под CreativeML license (такая же лицензия как у основных моделей)
Но работы еще ведутся и как в SDXL beta была только одна модель, а в SDXL 0.9 уже две, точно также у SDXL 1.0 может что-то поменяться/оптимизироваться так что когда выйдет - тогда и посмотрим. Грозятся выпустить в середине июля. Ну что ж, ждем.
Поиграться с пробной версией SDXL 0.9 можно тут
Post #73
1.64K
- ❤ 15
- 👍 6
- 👏 2
- ❤🔥 1