Выложил в открытый доступ инструмент, который гоняю у себя каждый день, — движок расшифровки речи и разметки по спикерам.
Что делает: берёт запись встречи, превращает в текст с таймкодами (faster-whisper), разделяет реплики по говорящим (pyannote) и узнаёт голоса по «отпечатку» (voiceprint). Можно поднять свой узел, задать в конфиге свои источники и приёмники — и раскидать обработку на несколько машин. Хорошо работает на PC и Mac. Но автозапуск еще требует танцев с бубнами
Главный для меня принцип тут — код открытый, данные приватные. Голос человека — это биометрия. Поэтому в репозиторий уходит только код, схемы и примеры конфигов. Ни голосов, ни имён, ни транскриптов — они остаются в вашем приватном хранилище, а не в git.
Лицензия MIT — берите, форкайте, приспосабливайте под себя.
👉 https://github.com/cless75/speaker-transcribe
Если поднимете у себя или увидите, что улучшить, — напишите, интересно сверяться. #vibe-engineering
Post #1012
1.23K