Тестируем модель MiniMax-Music3
MiniMax-Music3 - это модель с открытыми весами для генерации музыки с вокалом. Модель сравнительно небольшая и ее несложно запустить на локальном компьютере с GPU.
Она принимает на вход отдельно лирику и отдельно - промпт, который может включать описание жанра, тональности, вокала, инструментов, структуры композиции, а также прочие инструкции. Модель действительно реагирует на промпт, позволяя контролировать даже такие аспекты, как экспрессивность, эмоциональность, добавлять инструментальные партии между куплетами. Но всеми аспектами сразу управлять получается плоховато, и на один промпт могут получаться очень разные треки. Последнее может быть тоже полезно, но при массовой генерации вариантов.
Модель неплохо понимает русский, хотя иногда путается в ударениях, и вместо "ё" не стоит использовать "е". Иногда русское произношение звучит не совсем нативно, но приемлемо.
Модель работает довольно стабильно, но имеет трудности с тем, чтобы уложиться в заданное время - при идентичных настройках помимо random seed, может как закончить всю лирику слишком рано и начать повторяться, а может, наоборот, не уложиться. Но иногда попадает и точно.
Модель может интересно сочетать вокал и музыку, и даже иногда ей удается делать смысловые акценты, но нередко генерации получаются не слишком экспрессивные, даже если промпт явно задает обратное. Однако в целом результат оказывается неплох.
Пожалуй, от модели пока не стоит ожидать шедевр или хит... Однако года три назад открытые модели позволяли генерировать секунд десять-двадцать чего-то, что музыкой было весьма сложно назвать. Тогда мы с коллегами обсуждали, что биг тех корпорации пока еще до музыки не добрались, и вряд ли она им так интересна, как язык, код или хотя бы изображения. Что ж, теперь открытые модели генерации музыки делают несоизмеримо больше, чем пару-тройку лет назад.
Post #37
107
Audio
- 🔥 3
- 😱 1
- 👻 1
- 👀 1
- 🤝 1