ElevenLabs выпустила новое поколение речевых моделей
ElevenLabs выпустила Eleven v4 и v4 Turbo. Новая версия точнее воспроизводит тембр, акцент, интонации и манеру речи исходного голоса, а также лучше выполняет инструкции в тексте. Например, когда пользователь просит ИИ смеяться, говорить шёпотом, сердито или с определённым акцентом. Поддерживаемых языков стало больше 90 (вместо примерно 70 в прошлом поколении).
Обновилась и функция клонирования голоса. Мгновенное клонирование, по обещанию компании, более точно копирует оригинал. А профессиональное клонирование, которому для работы нужно заметно больше времени обучения и аудиозаписей-исходников, поддерживается в новой версии (в отличие от v3). Лимит одной генерации вырос до 10 тысяч символов, а длинные записи можно собирать из нескольких частей без заметных изменений в темпе и звучании.
Отдельно выпустили модель v4 Turbo предназначена для голосовых ИИ-агентов. Она начинает генерировать речь ещё до того, как получила предложение целиком, и, по внутреннему тесту ElevenLabs, первый звук появляется примерно через 150 мс. Обе модели уже доступны через API и сервисы ElevenLabs.
Post #1435
159
