☝🏻Alibaba выпустила CosyVoice 3 - модель синтеза речи с клонированием голоса всего за 3 секунды аудио Главная фишка - клонирование голоса: достаточно загрузить
3-10 секунд записи любого человека, и модель воспроизведёт его тембр
без дополнительного обучения.
При этом можно взять образец голоса на китайском и заставить его говорить на английском или
русском, сохраняя характерные особенности.
Теперь можно заставить Джейсона Стетхема рассказывать свои мысли на русском и оригинальным голосом.)
Я уже проверил на себе в
этом видеообзоре, особенно четко модель может повторить интонацию и картавость🤯
Скоро будет видео обзор на эту модель в ComfyUI. А пока, можете
этот ворк закинуть себе и попробовать сами.