А что если делать хенд мейд аудио книги?
Мой сын любит слушать аудиокниги. Но дикторы, которые ему нравятся озвучили далеко не все книги, которые ему интересны. Кажется что ИИ уже достаточно продвинулись чтобы можно было делать хенд мейд аудио издательство.
Поковырявшись в интернете и поспрашивая людей в теме я нашёл интересный проект на гитхабе https://github.com/DrewThomasson/ebook2audiobook Мне понравилась идея генерить всё локально без облаков и облачных сервисов. Ну и приятно что это условно бесплатно.
Установить это всё хозяйство с помощью описанного процесса в ридми у меня не получилось. Возможно в этом виноват арм процессор моего мака. Но если просто установить пакеты в нужное виртуальное окружение, то так оно завелось.
Что в итоге? Скорость генерации получается раза в полтора медленее чтения. Качество конечно иногда вызывает вопросики, но часто это лучше чем самопальные дикторы из ютуба.
Я пробовал два режима: встроенный голос и режим клонирования голоса. Встроенный как ни странно оказался лучше. Клонированный ещё можно добучить, чтобы пофиксить ударения, тембр и прочие мелкие штуки.
Прикрепил пару примеров. Женский голос - клонированный. Мужской - который был из коробки. Буду ковырять файн тюн. Следите за обновлениями.
Post #26
336