TGViewer
Derp Learning Derp Learning @derplearning · 13.9K subscribers
Post #4829 3.92K
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

Попытка пересадить эти ваши диффузии с иглы vae на rae.

Основная разница в том, что с rae латент больше отражает сущности нежели текстуры.

Если завалящий sd vae жмет rgb картинку 1024х1024х3 в 128х128х4, rae - в 64х64х1024

Так как даже в unet архитектуре stable diffusion основным ботлнеком по памяти был все равно аттеншен, новый подход позволяет обойти эту проблему, тк он больше чувствителен к количеству токенов, чем их размерности.

Модели на таком латентном пространстве учатся быстрее, инференсятся за меньшее количество шагов (хоть и более тяжёлых), все счастливы.

Все потому, что vae latent это просто уменьшенная картинка, а rae - семантическое описание сцены с общим указанием координат.

Hf paper
  • 🔥 9
  • ❤ 5
  • 👨‍💻 2
  • 👀 2
  • 🤡 1
More from @derplearning
  1. Oct 4, 2026photo post
  2. Oct 3, 2026Реклама WinRAR, которая ни на что не намекает r/#aivideo
  3. Oct 1, 2026Хорошая, дорогая рекламная компания от робототехнической компании Figure. Нужно было краси…
  4. Sep 29, 2026Это вам за то что не молитесь Надо было еще на ГПТ ГПТ заменить, эх.
  5. Sep 27, 2026Ии начинает маскироваться под людей! Сегодня ставишь ты em dash, а завтра Дарио продашь!
  6. Sep 27, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →