🎶 Riffusion — модель для генерации музыки на основе Stable Diffusion 🎹
Модель Stable Diffusion взбудоражила умы разработчиков Сета Форсгрена и Айка Мартироса, которые создали свой проект Riffusion для генерации музыки.
Почему Riffusion?
Название проекта — это слияние двух слов riff («рифф») + diffusion («диффузия»). Настроив модель, Сет и Айк научили ее генерировать спектрограммы, которые затем можно конвертировать в музыку.
Как же им это удалось?
За основу разработчики взяли Stable Diffusion v1.5, которую затем натренировали на спектрограммах, дополненных текстовыми комментариями. Спектрограмма — это визуальное представление спектра из частот сигнала, изменяющегося во времени. Используя оконное преобразование Фурье (звучит уже страшно), разработчики конвертировали аудиофайлы в спектрограммы. Данный способ позволяет и изображения, сгенерированные моделью, преобразовать в аудио, поэтому Сет и Айк дополнили непосредственно сам процесс создания музыки алгоритмом Гриффина-Лима для восстановления фаз (так как модель генерирует только амплитуду колебаний волны, но не фазы).
С подробностями зацикливания аудио отрывков и их интерполяции, а также примерами можно ознакомиться в статье.
Ну что, товарищи музыканты, сможет ли Riffusion написать новую «Лунную сонату» или «We will rock you»?
Post #876
11.5K
- 🔥 18
- 👍 4
- ❤ 2