TGViewer
CV Time CV Time @timeforcv · 3.47K subscribers
Post #294 2.31K
High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

Сегодня разбираем статью о Z-Image Turbo++. Основная идея — повторное применение DMD к уже задистилелной модели. Так авторы дистиллируют 8-шаговый Z-Image Turbo в 2-шаговый генератор. Достигается это с помощью трёх приёмов:

1) Distribution-aligned adversarial training. В качестве «настоящих» семплов для дискриминатора GAN используют не реальные фотографии, а изображения, сгенерированные 8-шаговым teacher'ом. Так семплы тяжелее различить дискриминатору. По наблюдениям авторов, подмена реальных изображений сгенерированными стабилизирует обучение, а итоговая модель даёт меньше артефактов. Возможно, использование дополнительных техник для усложнения задачи дискриминатора, например R1-регуляризации, стабилизировало обучение с реальными данными.

2) Step-decoupled weights. Шагам 1 и 2 дают по собственной полной копии весов (обе инициализируются из teacher) вместо одной общей модели. Два шага решают очень разные подзадачи (шум → грубое изображение vs грубое изображение → чистое изображение). Поэтому одной общей модели не хватает ёмкости на оба шага. Использование отдельных LoRA-адаптеров для каждого шага работает хуже, чем тюнинг всех весов — например, для отрисовки текста.

3) End-to-end-обучение c отдельным лоссом для каждого шага. Оба шага обучаются вместе как единый пайплайн (шум → модель шага 1 → промежуточный результат → модель шага 2 → финальное изображение), так что градиенты от качества финального изображения текут обратно и в шаг 1, а не только в шаг 2. Важно, что при этом сохраняется явный лосс на собственном промежуточном выходе шага 1 (той же формы, что и лосс шага 2). Если его убрать, промежуточный результат первого шага коллапсирует в бессмысленное представление — и модель на последнем шаге исправляет это представление вместо того, чтобы просто добавить деталей.

Разбор подготовил Александр Целоусов
CV Time
  • ❤ 9
  • 👍 8
  • 💯 6
  • 🔥 1
  • 🤝 1
More from @timeforcv
  1. Sep 16, 2026When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virt…
  2. Sep 14, 2026Trustworthy Image Authentication using Forensic Knowledge Graphs На ECCV 2026 прослеживали…
  3. Sep 11, 2026Мы всё ещё на ECCV: репортаж с воркшопа о квантовых вычислениях в компьютерном зрении Наш…
  4. Sep 10, 2026Больше CV на ECCV! Наши инженеры поделились ещё двумя интересными работами на тему компьют…
  5. Sep 9, 2026Интересные доклады с ECCV 2026 С 8 сентября в шведском Мальмё проходит ECCV — Европейская…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →