Компания назвала их самыми эмоциональными моделями из всех существующих:
🔅Теперь поддерживают 90 языков — прошлые могли говорить на 70 (русский на месте);
🔅Максимально реалистичное КЛОНИРОВАНИЕ голоса — достаточно 10-секундного куска;
🔅Модели сами адаптируют интонацию под текст и не теряют голос на длинных разговорах;
🔅Эмоциями можно управлять через теги:
[excited, happy], [laughs], [said angrily in French accent];🔅Можно даже делать фоновые звуки:
[light rain] и [phone buzzing];🔅Эмоции можно ставить подряд, и нейронка отыграет их по порядку;
🔅Генерация у Turbo-версии занимает 1️⃣5️⃣0️⃣миллисекунд — можно стримить голос в прямом эфире.
Тестируем тут.
🙂 Не баг, а фича