Nvidia представила модель искусственного интеллекта Fugatto, которая на основе текстовых подсказок может сгенерировать и преобразовать любую комбинацию музыки, голосов и звуков. Модель может редактировать готовые аудиофайлы и, по словам разработчиков, создавать немыслимые сочетания: от мяукающего саксофона до смеси грозы с метелью.
Для создания Fugatto исследователи собрали обширный набор данных, включающий в себя миллионы аудиосэмплов. Были также разработаны специальные инструкции, которые «значительно расширили спектр задач модели, повысили точность ее работы и позволили выполнять новые функции без необходимости в дополнительных данных».
Главная особенность Fugatto заключается в том, что она может не просто имитировать существующие звуки, но и создавать принципиально новые композиции. Например, модель может заставить трубу лаять, саксофон мяукать, а также генерировать уникальные звуковые ландшафты, которых не существует в реальном мире. При этом модель может генерировать звуки и музыку, которые не «слышала» при обучении.
Модель имеет не только развлекательное применение. Музыкальные продюсеры могут использовать Fugatto для прототипирования или редактирования композиций, добавления эффектов или экспериментов с новыми жанрами и стилями. Рекламные агентства смогут адаптировать кампании под разные рынки, добавляя уникальные акценты и эффекты.
📚Тематические ссылки:
https://blogs.nvidia.com/blog/fugatto-gen-ai-sound-model/
https://youtu.be/qj1Sp8He6e4
https://hightech.fm/2024/11/26/nvidia-music-ai
Post #101
404

- 🤔 2
- 🔥 1