☝🏻Alibaba выпустила CosyVoice 3 - модель синтеза речи с клонированием голоса всего за 3 секунды аудио
Главная фишка - клонирование голоса: достаточно загрузить 3-10 секунд записи любого человека, и модель воспроизведёт его тембр без дополнительного обучения.
При этом можно взять образец голоса на китайском и заставить его говорить на английском или русском, сохраняя характерные особенности.
Теперь можно заставить Джейсона Стетхема рассказывать свои мысли на русском и оригинальным голосом.)
Я уже проверил на себе в этом видеообзоре, особенно четко модель может повторить интонацию и картавость🤯
Скоро будет видео обзор на эту модель в ComfyUI. А пока, можете этот ворк закинуть себе и попробовать сами.
Post #25
823
- 👌 3
- 💘 1