Fish Audio выкатила Drama 3 — генератор речи с управлением эмоциями обычным текстом
Главное изменение: вместо жёстких аудиотегов на 1–2 слова модель теперь лучше понимает обычное текстовое описание. Можно прямо в промте объяснить интонацию, темп, характер персонажа и то, как должна звучать сцена.
Что умеет Drama 3:
— точечно перегенерировать одно слово или фразу в уже готовой дорожке
— не трогать остальной аудиофрагмент при правке
— переключаться на другой голос прямо внутри предложения
— генерировать диалог нескольких персонажей за один проход
— работать на русском языке
В тестах разница с версией 2.1 заметна. Старая модель местами игнорировала теги вроде crowd laughing и excited, а ещё часто промахивалась с ударениями.
В Drama 3 тот же сценарий звучит чище: текст читается понятнее, интонация ближе к заданной, а управление через обычные описания работает естественнее, чем через короткие команды-теги.
Без косяков пока не обошлось: например, crowd clapping модель тоже может проигнорировать. Но в целом превью уже выглядит бодро, особенно с учётом русского языка и правки отдельных фрагментов без полной перегенерации.
Документация:
https://docs.fish.audio/api-reference/endpoint/openapi-v1/text-to-speech
Post #5886
160