TGViewer
VF | Science VF | Science @vf_science · 1.13K subscribers
Post #368 971
👀 Image Understanding Makes for A Good Tokenizer for Image Generation
[paper] | [code] | NIPS 2024

Вот есть Image Generation (IG) и Image Understanding (IU) модели (рис. 1). IG модели помогают IU моделям, путем генерации синтетических данных, улучшения representation learning'а, добавления промежуточных фичей из IG моделей для perception задач. А что IU модели могут сделать для IG моделей?) Спойлер: качество генерации лучше, если считать лосс реконструкции не по пикселям, а по feature maps из предобученного энкодера, учитывающего семантическую информацию изображений.

Авторы также обнаружили, что токенайзеры с более слабыми возможностями IU требуют более крупных авторегрессионок и демонстрируют меньшую устойчивость к изменениям в обучающих изображениях.

Мы, конечно, будем снова обсуждать модели с VQ-VAE, а вы что подумали) Авторегрессионная генерация изображений на VQ токенах делается в 2 этапа (рис. 2). Сначала обучают VQ-VAE на реконструкцию, потом заменяют CNN декодер на какой-нибудь трансформер и учатся генерировать изображения, используя предобученный кодбук.

Пока мы учим модель реконструкции, мы по сути учим модель запоминать детальное расположение пикселей, то есть модель не видит никакой семантики в данных. Авторы предложили исправить это и составлять кодбук, учитывающий семантику изображений.

Чтобы учитывать семантику изображений, логично использовать предобученные энкодеры, например CLIP. Теперь модель обучается реконструировать feature maps из предобученного энкодера (учителя) (рис. 3). Подход называется VQ-KD и он не новый. Это просто дистилляция знаний от предварительно обученных IU-энкодеров к токенайзерам. Может показаться, что можно просто заменить энкодер перед векторным квантованием, но это другое. Здесь декодер D(C(z)) учится минимизировать косинусное расстояние до feature maps учителя x^t. C(z) это векторное квантование.
L_rec = − cos(D(C(z)), x^t)


В контексте генерации изображений авторы исследуют четыре IU-энкодера: ViT, CLIP, DINO и MAE. Как итог: метрики значительно растут на разных датасетах и декодерах, кодбук используется под 100%, ведь авторы знают про FSQ и CVQ-VAE, все хорошо.

Только вот я не понял уникальности работы, многое основано на статье про BEIT V2. Однако ревьюеры на NIPS 2024 даже 4/5 ставили. Статья написана просто отлично, но все же.

#papers #vqvae #images
  • ❤ 4
  • 👍 4
  • 🤔 1
More from @vf_science
  1. Aug 24, 2026Оператор скам центра на связи #life #memes
  2. Aug 2, 2026А еще есть Денис (@bceloss), мой друг. Ему 17, а его также зовут на подобные позиции и он…
  3. Aug 2, 2026Позволю себе поделиться историей… Я уже 4 месяца без работы живу жизнь Тяжелеющая история…
  4. Aug 2, 2026Гуляю такой возле дома на Ходынке… Думал отдохнуть от работы
  5. Jul 17, 2026🎉 Подготовили статью "Dialogs: a studio-quality expressive conversational Russian speech…
  6. Jul 5, 2026афтепати на ACL... фу а можно мне тоже?
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →