Вы когда-нибудь мечтали стать лучшей версией себя? А LoRA уже стала!
Рад представить вам нашу новую работу
T-LoRA: Single Image Diffusion Model Customization Without Overfitting ✔️
Представьте, что вы хотите дообучить модель генерировать новый объект, например, кошку или чайник. Но у вас
ВСЕГО ОДНА КАРТИНКА этого объекта. Вы обучаете LoRA. И что выходит? Полный провал. Модель переобучается: объект генерируется только в той позе, в которой он был на тренировочной картинке, а фон выглядит скудно и плохо соответствует тексту.
В ходе нашей работы мы выяснили, что переобучение чаще всего происходит на самых шумных таймстепах. Именно они приводят к тому, что модель переобучается на фон и позу объекта. Мы предложили решение: ограничить ранг на шумных таймстепах, чтобы избежать переобучения, и дать больший ранг на средних и поздних таймстепах для точного запоминания объекта. На поздних таймстепах можно использовать высокие ранги без риска переобучения.
Эту идею мы реализовали с помощью маскирования столбцов LoRA, ограничивая тренировочный сигнал на шумных таймстепах. Более того, чтобы маскирование было эффективным, разработали ортогональную версию LoRA, которая сохраняет столбцы ортогональными на протяжении всего обучения.
Теперь ваша кошка может не только стоять, но и сидеть, и кататься на велосипеде, бегать, принимать любые позы, которые вы захотите. А фоны стали яркими, насыщенными и разнообразными.
👉
Поддержите нашу работу работу Upvote на HuggingFace. Это поможет как можно большему числу людей узнать, что делать в подобных тяжелых жизненных ситуациях с котиками 🙂
🔜
Arxiv🔜
GitHub🔜
HuggingFace