📄
MUNIT: Multimodal Unsupervised Image-to-Image Translation [ECCV 2018]Авторы работы добились мультимодальной генерации картинок между двумя доменами. Теперь не нужно обучать модель для каждой пары пород собак, т.к. порода — это просто
стиль собаки 🐶
Для этого общее латентное пространство разделяется на 2:
content и
style, причём общим остаётся только
content-пространство, а
style-пространство своё у каждого домена. Сэмплируя
стиль при генерации, авторы получают разные результаты.
Также в работе есть несколько теоретических результатов, наиболее важный из которых — доказательство, что cycle-consistency приводит к дельта-функциям распределения латентных кодов и как следствие к унимодальным результатам генерации.
10 эмбеддингов стиля из 10:
https://teletype.in/@ploshkin/munit