Вы когда-нибудь мечтали стать лучшей версией себя? А LoRA уже стала!😁
Рад представить вам нашу новую работу, написанную совместно с командой Controllable Generatinve AI: T-LoRA: Single Image Diffusion Model Customization Without Overfitting🎉
Представьте, что вы хотите дообучить модель генерировать новый объект, например, кошечку или чайник. Но у вас ВСЕГО ОДНА КАРТИНКА этого объекта. Вы обучаете LoRA. И что выходит? Полный провал. Модель переобучается: объект генерируется только в той позе, в которой он был на тренировочной картинке, а фон выглядит скудно и плохо соответствует тексту. 😤
Хорошо, что вы читаете этот пост и теперь знаете, что вам нужна T-LoRA!
В ходе нашей работы мы выяснили, что переобучение чаще всего происходит на самых шумных таймстепах. Именно они приводят к тому, что модель переобучается на фон и позу объекта. Мы предложили решение: ограничить ранг на шумных таймстепах, чтобы избежать переобучения, и дать больший ранг на средних и поздних таймстепах для точного запоминания объекта. На поздних таймстепах можно использовать высокие ранги без риска переобучения.
Эту идею мы реализовали с помощью маскирования столбцов LoRA, ограничивая тренировочный сигнал на шумных таймстепах. Более того, чтобы маскирование было эффективным, мы разработали ортогональную версию LoRA, которая сохраняет столбцы ортогональными на протяжении всего обучения.
И вот результат! Теперь ваша кошечка может не только стоять, но и сидеть, и кататься на велосипеде, бегать, принимать любые позы, которые вы захотите. А фоны стали яркими, насыщенными и разнообразными!
Мы будем очень благодарны, если вы поддержите нашу работу, поставив Upvote на 🤗HuggingFace. Это поможет как можно большему числу людей узнать, что делать в подобных тяжелых жизненных ситуациях! 😁
Спасибо за внимание!
📕Arxiv
🖥GitHub
🤗HuggingFace
Post #4
491

- 🔥 4
- 💅 4