На выходных закинул в соцсети две картинки про свои будни / воскресенья и собрал тонну лайков и вопросов: “Как ты это делаешь?” Вот вам простая пошаговая инструкция.
Мы будем использовать модель для генерации изображений Flux и создадим для нее LoRA со своим лицом. (воспринимайте LoRA как специальный плагин для модели, который знает, как выглядит какой-то уникальный объект. В нашем случае - это ваше лицо).
ВАЖНО: мы будем использовать сервис fal.ai - тренировка там стоит порядка $5, дальнейшие генерации около 3 центов. (можно бесплатно, но только если у вас есть карта Nvidia с видеопамятью выше 12Гб - для этого воспользуйтесь FluxGym на pinokio)
Итак, идём вот сюда (предварительно надо создать github аккаунт, тк авторизация только через него) и тыкаем салатовую кнопку Training, выбираем Train Flux LoRA Fast.
Закидываем минимум 10 своих фото с разных ракурсов (желательно без головных уборов, без очков, волосы не закрывают лицо и нет яркой косметики). Закидываем фотки только головы в хорошем качестве. Ещё важно, чтобы на фото были только вы, без посторонних.
Прописываем чуть ниже Trigger Word, например, ваше имя на английском (чем уникальнее имя, тем лучше, чтобы модель точно знала, что это вы).
Больше никаких настроек менять не нужно. Отправляем на тренировку (перед этим попросит пополнить баланс аккаунта на 5 баксов - принимает любые карты visa и MC. Я рекомендую пополнить сразу на 10, чтобы оставить ещё 5 долларов на генерации).
Идем пить чай. Через минут 15 у вас появится файл с LoRa. Переходим по этой ссылке и выбираем справа Run Inference напротив вашего файла.
Можно приступать к генерации любых вымышленных сцен вместе с вами. Очень важно в текстовом описании указывать ваше Trigger Word, например, у меня это shima.
Чтобы получить стилизованное под South Park изображение, я применял вот такой промпт:
full body shot of a bald {Trigger Word} with beard as a SouthPark character wearing yellow hoodie and gray shoes | cartoon South Park simple style | office backgroundОбычно требуется 5-12 реранов, чтобы получилось что-то адекватное, так что наберитесь терпения. Ещё можно подвигать ползунок CFG, если раскрыть меню More - это параметр, который отвечает за точное следование промпту. Лучше всего работает в области между 2 и 8. Чем выше значение, тем меньше будет LoRa, а больше будет слушаться промпта.
Вот и все - вы великолепны!
@aimastersme

