✨Черговий Paper Meetup в It-Jim ✨
Цього разу ми зібралися в гібридному форматі, щоб обговорити модель SAM Audio від Meta.
Ця модель дозволяє розділяти спіч, музику та будь-які інші звуки в одній архітектурі, використовуючи текстові, візуальні та аудіо промпти.
Коротко найважливіше:
✔ За своєю суттю SAM Audio є генеративною моделлю, яка використовує пряму генерацію - на виході маємо 2 аудіо: target і residual.
✔ Flow matching дозволяє досягти швидших і стабільніших результатів, ніж у класичних дифузійних моделях.
✔ Для обробки довгих аудіо - трек розділяється на частини з overlap за схемою: 20 с.+5 сек.
✔ Demucs все ще може бути актуальною для завдань, що вимагають чіткого time-alignment. SAM Audio надає більше гнучкості.
✔ Найкращі результати давало поєднання текстовий промптів і часових проміжків.
Рекомендуємо ознайомитися з усією статтею і кодом 🎶
Дуже дякуємо Устиму Хабурському за підготовку і модерацію зустрічі 🙌
Post #727
301

- ❤ 10