VibeVoice
При создании подкастов или длинных аудиокниг стандартные бесплатные TTS-инструменты обычно умеют синтезировать только несколько минут речи. Диалоги с несколькими участниками звучат жёстко и неестественно, без реалистичности.
Недавно Microsoft выложила в опенсорс модель для синтеза речи VibeVoice. Она умеет напрямую генерировать естественные диалоги до 90 минут.
Модель работает не только с очень длинным текстом, но и поддерживает до 4 разных говорящих. Она может автоматически добавлять фоновые звуки и музыку в зависимости от контента.
📁 Language: #Python 100%
⭐️ Stars: 4.4k
➡️ Cсылка на GitHub
📱 @git_developer
Post #985
3.88K
- ❤ 10
- 👍 9