ElevenLabs выкатила Eleven v4 и v4 Turbo — озвучка теперь не просто читает, а играет
Теперь в текст можно прямо вставлять теги вроде [laughs], [whispers] или [sighs], а модель добавит в голос смех, шёпот, вздохи, крики и даже звуковые эффекты — например дождь или закрывающуюся дверь.
Что ещё умеют модели:
— держать ровный тон и темп на длинных записях
— озвучивать без заметных артефактов на больших сценариях
— клонировать голос примерно по 10 секундам аудио
— работать более чем с 90 языками, включая русский
— бесшовно переключаться между языками внутри одной записи
— говорить клонированным голосом с нужным акцентом, а не тащить исходный
Отдельно вышла v4 Turbo — версия для живых голосовых агентов. У неё задержка до первого звука около 150 мс, то есть модель уже подходит не только для роликов и аудиокниг, но и для диалогов почти в реальном времени.
Попробовать:
https://elevenlabs.io/app/speech-synthesis/text-to-speech
Post #5864
151