whisper-diarization - диалогизация говорящих с использованием OpenAI WhisperВ этом репозитории объединены возможности
Whisper ASR с обнаружением голосовой активности (VAD) и векторным представлением говорящего для идентификации говорящего в каждом предложении транскрипции, сгенерированной Whisper. Сначала из аудио извлекаются вокальные данные для повышения точности векторного представления говорящего, затем с помощью Whisper генерируется транскрипция, после чего временные метки корректируются и выравниваются с помощью ctc-forced-aligner, чтобы минимизировать ошибку диаризации из-за временного сдвига. Затем аудио передается в MarbleNet для VAD и сегментации с целью исключения пауз, после чего используется TitaNet для извлечения векторных представлений говорящего для идентификации говорящего в каждом сегменте, результат затем сопоставляется с временными метками, сгенерированными ctc-forced-aligner, для определения говорящего в каждом слове на основе временных меток, а затем выравнивается с использованием моделей пунктуации для компенсации незначительных временных сдвиговhttps://github.com/MahmoudAshraf97/whisper-diarization
Подсказал: Eugene Sigitov - @e_sigitov
Опубликовано в @gitgate
#sst #llm #openai #whisper