27b заняла 2 3090, и у меня осталась свободная RTX A4000 16GB. Я туда поставил gemma e4b q6 для мелочей, типа генерации тего, тайтлов чатов в openwebui и тд. Плюс я там поставил whisper для STT и, так как я хотел read-aloud в openwebui, я поискал что там есть и взял omnivoice.
Для omnivoice пришлось написать свой оркестратор, который подготавливает текст (например меняет цифры на слова через gemma e4b), режет текст на чанки, и потом через whisper проверяет что чанк сгенерировался корректно. Я, в целом, особо не заморачивался, просто попросил клод скачать штуки 4 оркестраторов omnivoice, и посмотреть какие трюки у них используются в генерации, а потом все эти бест практисес применить.
В общем, выглядит неплохо. 18 минут достаточно стабильные получились. Хочу сейчас еще доделать регенерацию конкретных чанков, чтобы не нужно было все аудио генерить заново, а только проблемные куски, и, по-моему идеально.
На 18 мин аудио уходит где-то 5-7 минут.
Войс клон тоже неплохо работает: даешь ему 15 секунд голоса и текст, который этот голос читает, и все, можно генерить что хочешь.
Post #781
285
- ❤ 1
- 🔥 1