🎙️ OuteTTS-0.2-500M: обновление TTS-модели с улучшенным клонированием голоса
OuteTTS-0.2-500M — новая версия модели синтеза речи, основанная на Qwen-2.5-0.5B. Обучена на улучшенных датасетах (Emilia-Dataset, LibriTTS-R, Multilingual LibriSpeech) с поддержкой контекста до 4096 токенов (~54 секунды звука).
### Что нового?
🟢 Точность: Более согласованное следование промптам.
🟢 Натуральность: Ещё более естественная и плавная речь.
🟢 Словарь: Тренировка на 5+ млрд аудио-токенов.
🟢 Клонирование голоса: Точность и вариативность улучшены.
🟢 Многоязычность: Поддержка китайского, японского и корейского языков (экспериментально).
https://www.outeai.com/blog/outetts-0.2-500m
https://huggingface.co/OuteAI/OuteTTS-0.2-500M
Post #974
1.56K