Есть ли альтернатива ElevenLabs в клонировании голоса?
Сегодня поделюсь интересным кейсом, который сейчас находится у меня в работе. Перед нами стояла задача обеспечить для клиента качественное решение по клонированию голоса в рамках его продукта. Первое, что приходит на ум - ElevenLabs. Однако, при ближайшем рассмотрении всплыли две проблемы: высокая цена и не самые щедрые лимиты на использование, которые не вписывались в планируемые объемы.
Это навело на мысль: “А вдруг для данного проекта может быть выгоднее развернуть OpenSource модель со старта?”. Мы начали ресерч!
Open Source: ожидания vs реальность
В процессе мы протестировали следующие модели:
1. Zonos-v0.1-transformer: Модель показала себя лучше всех. Качество и натуральность голоса были на высоте. Несмотря на то, что генерация происходит 30-секундными фрагментами, собрать из них 15-минутный аудиофайл можно было достаточно оперативно.
2. Dia (nari-labs/Dia-1.6B): Довольно свежая модель, разработанная группой студентов :) Интересная особенность - неплохо передает эмоциональные оттенки голоса. Однако, по общему качеству и стабильности до Zonos не дотянула.
3. Spark TTS: У этой модели были проблемы с качеством клонируемого голоса - оно оказалось довольно низким, плюс периодически возникали артефакты в виде дублирования фраз, а скорость генерации оставляла желать лучшего.
4. Openvoice: Эта модель генерировала голос очень быстро, но качество сильно уступало. Возможно, ее можно было бы рассматривать в связке с другими инструментами для последующего улучшения качества, но "из коробки" результат был не тот, что мы искали.
5. Также мы протестировали Orpheus, Kokoro, MegaTTS3, F5TTS, однако они либо не могли клонировать голос “из коробки” либо имели ограничения в лицензии, либо вообще не запустились.
В целом, основные вызовы при работе с OpenSource для клонирования голоса были следующие: нестабильное качество, наличие артефактов, невысокая скорость генерации для некоторых моделей и, конечно, необходимость дополнительных ресурсов для развертывания и поддержки. Полный ресерч моделей тут.
Вендоры почти пришли на помощь
Параллельно с исследованием OpenSouce мы, разумеется, искали и коммерческие альтернативы. И здесь нашим фаворитом стал сервис Speechify. Он продемонстрировал хорошее качество как клонирования голоса, так и самой генерации речи, что для нас было критично. Но, как ни странно, нам он показался хуже Zonos.
Если говорить о стоимости, то для наших задач (условно, генерация 30 аудиофрагментов в месяц на пользователя), Speechify оказался значительно выгоднее: примерно в 8 раз дешевле, чем селф-хост опенсорсной модели и в 9 раз дешевле, чем ElevenLabs.
Что мы выбрали?
ElevenLabs - круто, но дорого и лимиты, Zonos - хорош, но возможно оверкилл на запуске, т.к. стоит почти как ElevenLabs, Speechify - норм по цене, но качество хуже двух предыдущих. В общем, технический ресерч не обещал легкой прогулки. Выбирать нужно между “дорого” и “не самый лучший UX”. Считайте как задачка про два стула :)
Мы выбрали третий. Стартовать продукт решили без функции клонирования голоса, а саму ее сделать в формате традиционной Fake Door - добавим кнопку функции в апку, повесив на нее аналитику по кликам.
Далее, при достижении нужных метрик у нас будет 3 варианта:
- полный селф-хост Zonos или другой модели при хорошем кол-ве платящих и неплохом проценте кликнувших на фичу;
- Speechify, если платящих не так много, но много кликнувших;
- модели по тарифам: например в базовом будет Speechify, а премиум на Elevenlabs, если очень много платящих и большой процент из них кликнули.
Пока готовил этот пост - вышла Chatterbox - я ее пощупал, очень крутая и, на мой взгляд, лучше Zonos!
Чему учит этот кейс?
1. Всегда делайте технический ресерч вашего продукта;
2. Обязательно смотрите на лицензии;
3. Не верьте карточкам с описанием моделей;
4. Все меняется очень быстро, наш ресерч уже устарел :)
5. Всегда работайте итеративно и проводите эксперименты (у нас это тесты моделей и Fake Door);
6. Ищите альтернативы, а не бейте в одну точку, наличие выбора лучше, чем его отсутствие
#кейсы
Post #369
1.21K