В моем докладе на DataFest2024 будет часть про модель VQ-VAE, которая играет ключевую роль в решении задачи. Весьма популярная модель, от которой получаются полезные репрезентации.
Эти репрезентации можно использовать для самых разных задач:
*️⃣ Подружить текст с изображениями и звуком. Привет мультимодалки!
*️⃣ Подавать кодированые векторы на вход всяким трансформерам и решать множество sec2sec задач. Например генерация нот на основе аудио из моего доклада :)
*️⃣ Да и классификацию изображений/аудио решать тоже можно.
Архитектура состоит из трех основных компонентов:
*️⃣ Энкодер, который преобразует данные (например, изображение или аудиозапись) в компактное представление — латентное пространство.
*️⃣ Операция векторного квантования (VQ), где данные из латентного пространства сопоставляются с ближайшими токенами из кодовой книги.
*️⃣ Декодер, который восстанавливает данные из этих токенов.
Благодаря такой структуре VQ-VAE может не только сжимать данные, но и генерировать новые, например, создавать музыку, изображения или видео.
Оригинальная статья:
*️⃣proceedings.neurips.cc/paper/2017/hash/7a98af17e63a0ac09ce2e96d03992fbc-Abstract.html
Продолжение статьи:
*️⃣ proceedings.neurips.cc/paper/2019/hash/5f8e2fa1718d1bbcadf1cd9c7a54fb8c-Abstract.html
Подробнее про векторное квантование:
*️⃣ mqasem.net/vectorquantization/vq.html
*️⃣ assemblyai.com/blog/what-is-residual-vector-quantization/
*️⃣ speechprocessingbook.aalto.fi/Modelling/Vector_quantization_VQ.html
#papers #music_generation
Post #119
1.29K







- 👍 7