OpenMOSS выпустили MOSS-TTS v1.5 - обновление своей открытой TTS-модели на 8B параметров.
Главная фича выглядит простой, но для реальных сценариев очень важная: теперь паузы можно задавать прямо внутри текста через
[pause 3.2s]. То есть моделью можно управлять не только на уровне «прочитай фразу», а точнее собирать ритм, драматургию и естественные остановки в речи.Что нового в v1.5:
- поддержка 31 языка вместо 20
- добавлены Cantonese, Hindi, Thai, Vietnamese, Tagalog, Swahili и другие
- более стабильное voice cloning без сильного разброса между повторными генерациями
- лучше работает сценарий, когда референс длинный, а целевой текст короткий
- улучшена просодия по пунктуации, особенно в длинных предложениях
- сохранены возможности v1.0: zero-shot cloning, long-form speech, Pinyin/IPA control и code-switching
GitHub:
https://github.com/OpenMOSS/MOSS-TTS
ModelScope:
https://modelscope.ai/models/OpenMOSS-Team/MOSS-TTS-v1.5