Наконец можно сгенерировать любую аудиокнигу локально! Правда есть нюанс...
Сегодня погонял локальную модель для генерации голоса https://github.com/resemble-ai/chatterbox. У них есть мультиязычная модель которая поддерживает 23 языка, в том числе русский. Можно испльзовать существующий голос или клонировать.
Несколько особенностей:
- большой текст нужно разбивать на маленькие кусочки, иначе не хватает памяти
- аудио для клонирования голоса чем длинее, тем лучше
- нужно расставлять ударения в тексте, тогда качество заметно выше
- 15 минут аудио это 13648 знаков или 1864 слов или 99 предложений
К посту приложил 15 минутный отрывок из «Незнайки на луне» Носова с итальянским акцентом. Отрывок генерировался 90 минут, тот самый нюанс.
Приятного прослушивания.
Post #50
260
Audio
- 🔥 4