[paper] | [code] | NIPS 2024
Вот есть Image Generation (IG) и Image Understanding (IU) модели (рис. 1). IG модели помогают IU моделям, путем генерации синтетических данных, улучшения representation learning'а, добавления промежуточных фичей из IG моделей для perception задач. А что IU модели могут сделать для IG моделей?) Спойлер: качество генерации лучше, если считать лосс реконструкции не по пикселям, а по feature maps из предобученного энкодера, учитывающего семантическую информацию изображений.
Авторы также обнаружили, что токенайзеры с более слабыми возможностями IU требуют более крупных авторегрессионок и демонстрируют меньшую устойчивость к изменениям в обучающих изображениях.
Мы, конечно, будем снова обсуждать модели с VQ-VAE, а вы что подумали) Авторегрессионная генерация изображений на VQ токенах делается в 2 этапа (рис. 2). Сначала обучают VQ-VAE на реконструкцию, потом заменяют CNN декодер на какой-нибудь трансформер и учатся генерировать изображения, используя предобученный кодбук.
Пока мы учим модель реконструкции, мы по сути учим модель запоминать детальное расположение пикселей, то есть модель не видит никакой семантики в данных. Авторы предложили исправить это и составлять кодбук, учитывающий семантику изображений.
Чтобы учитывать семантику изображений, логично использовать предобученные энкодеры, например CLIP. Теперь модель обучается реконструировать feature maps из предобученного энкодера (учителя) (рис. 3). Подход называется VQ-KD и он не новый. Это просто дистилляция знаний от предварительно обученных IU-энкодеров к токенайзерам. Может показаться, что можно просто заменить энкодер перед векторным квантованием, но это другое. Здесь декодер D(C(z)) учится минимизировать косинусное расстояние до feature maps учителя x^t. C(z) это векторное квантование.
L_rec = − cos(D(C(z)), x^t)
В контексте генерации изображений авторы исследуют четыре IU-энкодера: ViT, CLIP, DINO и MAE. Как итог: метрики значительно растут на разных датасетах и декодерах, кодбук используется под 100%, ведь авторы знают про FSQ и CVQ-VAE, все хорошо.
Только вот я не понял уникальности работы, многое основано на статье про BEIT V2. Однако ревьюеры на NIPS 2024 даже 4/5 ставили. Статья написана просто отлично, но все же.
#papers #vqvae #images



