Гугл выпустил* Text-to-Music модель MusicLM, которая видимо новая SOTA в этой области (и хайпит в AI Твиттере сейчас)
Принципиальных отличий там несколько:
1. Взяли CLIP-подобную модель MuLan, где общее эмбеддинговое пространство между текстом и аудо-треками (44M семплов тренировочных!)
2. Стали генерировать иерархически – на инференсе переводят текст в аудио-токены через эту модель MuLan, с помощью них получают семантические токены (можно о них думать как о маппинге между аудио-токенами и их семантикой), и потом они вместе обуславливают генерацию финальных акустических токенов
3. Выпустили видимо первый бенчмарк в этой области, где 5.5k треков были вручную размечены живыми (!) музыкантами
Понравилось их демо – во-первых, можно очень сильно изощряться в описании треков (как на скрине). Во-вторых, можно генерировать музыку по описанию картин из Википедии (для совсем эстетов). В-третьих, там можно полушать как звучит accordion rap и accordion death metal 💃
*как всегда с моделями для музыки релизнули пока ток датасет
https://google-research.github.io/seanet/musiclm/examples/
Post #897
2.43K
- 🔥 13
- 👍 2
- 🤯 1