ElevenLabs выпустила Eleven v4 и Turbo v4 для реального времени
ElevenLabs выкатила обновление моделей для генерации речи. Модели уже доступны в ElevenAgents, ElevenCreative и через API, включая бесплатный тариф.
⚙️ Новая архитектура. Модель читает текст как актёр: разбирает тон, темп, характер и контекст целой сцены, поэтому реплики в диалоге отвечают друг другу, а не склеиваются из отдельных строк.
В слепых парных тестах около 75% слушателей предпочли v4, в рейтинге Artificial Analysis она первая.
📊 Turbo: модель реального времени держит медианную задержку инференса около 100 мс и отдаёт первый звук за 150 мс.
Для сравнения, - у Cartesia Sonic 3.6 это 262 мс, у OpenAI GPT-4o mini TTS 814 мс.
Стриминг двусторонний: текст уходит по мере генерации от LLM, а аудио приходит, не дожидаясь конца предложения.
🌍 Языки и клоны. Заявлено больше 90 языков, в API модель сейчас отдаёт 85, у v3 было 74. Голос клонируется с 10 секунд записи. Профессиональные клоны вернулись после того, как их убрали в v3, а клоны, сделанные до релиза, придётся обучать заново.
🎭 Управление подачей. Метки в тексте модель держит точнее, чем v3, и понимает их цепочки. SSML отключили, поэтому паузы задаются метками [pause] и [long pause]. Поддержку IPA улучшили: произношение имён и терминов ставится надёжнее.
💼 Зачем бизнесу. Модель рассчитана на голосовых агентов: Turbo отвечает в темпе живого разговора, и платформу для агентов компания оптимизировала вместе с моделью.
Аудиокниги и реклама получают ровный, выразительный голос на длинных текстах.
Цены прежние: бесплатно 10 000 кредитов в месяц, это примерно 10 минут звука, платные тарифы от $6.
📎 Страница модели
Голос в новости, - генерация ElevenLabs v4
Картинка - HeyGen Avatar v4
#ElevenLabs #голос
———
@tsingular
Post #8685
1.72K