Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
[Статья] [Код]
Введение
RAE (Represenation Auto Encoders) ранее неплохо себя показали в качестве альтернативы VAE в задаче Class Conditional генерации.
Однако валидации на масштабе и для задачи text-2-image не было. Поэтому вопрос о масштабируемости парадигмы оставался открытым.
И вот коллектив оригинальных авторов + ЛеКун выпустили продолжение с экспериментами на t2i.
Post #632
1.69K

- ❤ 2