Недавно потребовалось оценить качество Zero Shot Voice Cloning моделей доступных в опен соурсе. Формальные результаты будут чуть позже, когда будут оценки на другие свойства подобных систем. А пока что что только Speaker Similarity Evaluation - самый важный для клноирования речи - оценка того, как хорошо клноируется тембр голоса (в первую очередь) и стиль (во вторую очередь). Для эксперимента использовался большой корпус речи на английском в высоком качестве.
1️⃣ Zero Shot все еще как рулетка - повезет, и отлично склонирует тембр голоса. Но как правило чаще не везет. Zero Shot уступает подходам с файн-тюном (например, адаптер поверх большой модели на нескольких минутах речи будет гораздо более предсказуемо себя вести).
2️⃣Попробовал все опенсоурсные модели дла английского языка из TTS арены и последних релизов поддерживающих Voice Cloning, топ от лучшей к худшей модели получился вот такой:
1️⃣ llasa 3B (код, лицензия CC-BY-NC-4.0, статья, демо)
2️⃣fish speech v 1.5 (код, лицензия CC-BY-NC-4.0, docs)
3️⃣Zonos-v0.1-transformer (код, лицензия Apache 2.0, разбор модели, демо)
4️⃣xtts2 (код, лицензия Coqui XTTS Commercial License, статья)
5️⃣open voice (код, лицензия MIT)
3️⃣ Модели, что идут под лицензиями, запрещающими прямое коммерческое использование (1 и 2) - существенно сильно лучше открытых. Насколько существенно - расскажу чуть позже, когда появятся еще больше метрик тестирования моделей. Так что построить свой войс клонинг систему только из того что доступно в коммьюнити без вложений - будет затруднительно. Интересно, как репо/статья/пост абсолютно каждой модели громкго говорит, что "мы SOTA"
4️⃣ В дополнении к предыдущему пункту: разрыв с коммерческими системами прям ощутимый. Если не в самом качестве клноирования (11Labs тоже часто лажает за пределами английского), то в удобстве использования, как минимум есть консистентность в синтезе между предложениями (у Zonos все очень плохо в этом смысле)
5️⃣Все системы очень чувстивтельны к качеству reference (промт) аудио. Любой лишний шум, бэкграунд звуки, длинные паузы (как часто бывает у fiction персонажей) ломают систему и на синтезе получается мусор. Поэтому рабочий пайплайн такой:
*️⃣Найти как можно более чистый сэмпл голоса, который хотите склонировать: без шумов, эхо, в хорошем разрешении
*️⃣Забить на шаг выше и положиться на Audio Enchancer, например от Adobe (придется заплатить, если хотите использовать в масштабе)
*️⃣Запустить инференс.
💡По этой схеме получилось хорошо склонировать голос Дамблдора с помощью llasa 3B.
Прикладываю в сообщении ниже (какой-то кривой у тг редактор):
[1] Оригинальный сэмпл (взят с ютуба, вырезка из фильма, слышны разные эффекты на бэкграунде).
[2]Очищенный с помощью Адобе.
[3] Синтез Моделью. Можете заметить, как модель галлюционирует в самом конце, хотя текст довольно простой: всего лишь прошу Дамблдора объяснить, что такое Философия 🙂
Если хотите попробовать склонировать свой голос или просто поиграть - вот демка. Модель поддерживает только Английский и Китайский.
🎙Оставив все этические аспекты вопроса клонирования голоса, расскажите, что вы думаете на этот счет? Может быть какая-то модель упущена? Или поделитесь своим опытом клонирования
#разбор
Post #38
1.85K