🗣 Вторая версия системы синтеза речи от компании inworld
Компания Inworld выпустила модель Realtime TTS-2. Разработка заняла первое место в рейтинге Artificial Analysis. Задержка до начала генерации речи составляет всего 100 мс.
Главной фишкой стало управление голосом через обычный текст. Можно прописать, как именно должна звучать фраза.
Возможности системы:
🎙 произношение в разных стилях: тепло, раздраженно, шепотом или сквозь зубы
🎙 автоматическая подстройка интонации под описание
🎙 поддержка 200 языков для одного голоса
🎙 профессиональное клонирование и создание голосов по описанию
🎙 учет контекста нескольких реплик
Параллельно вышла версия Flash с задержкой 25 мс и сниженной ценой. Технологию уже используют в играх и сервисах для обучения языкам.
©Artificial_Intelligence_Relations
🤖 Ринат Шакиров | Промпты для Midjourney | ChatGPT
Post #5368
1K