90% правок нейросети я даю голосом. За две минуты так объясняешь больше, чем успел бы набрать за десять. Но Whisper, самая ходовая модель в приложениях для диктовки вроде Handy, с русским справляется так себе (я делал замеры на больших датасетах), а на рабочем сленге и названиях продуктов спотыкается любая модель.
Поэтому я собрал скилл transcriber, и теперь через него проходит каждая моя диктовка, интервью и созвон.
Что он умеет:
— Действительно качественно распознавать русскую речь и проверять сам себя.
Основная модель — GigaAM от Сбера, а не Whisper: она ошибается в 2,3 раза реже.
Вторая модель другой архитектуры независимо слушает ту же запись и формирует список правок для починки.
Все это работает и для английского — со своей парой моделей, тоже проверенной замерами.
— Не терять названия и корпоративные термины.
Словарь терминов собирается сам из расхождений моделей, мне остаётся изредка подтвердить написание.
— Превращать видео и подкасты в текст.
YouTube, VK Видео, Rutube, выпуски подкастов Яндекс Музыки, хоть плейлисты целиком. Это полноценная расшифровка, а не пересказ автосубтитров. Если для конкретного видео точность не так важна, скилл за секунды возьмёт и готовые субтитры с YouTube.
— Подхватывать диктовки из Handy.
Да, все настолько круто! Фоновый агент сам прогоняет каждую запись длиннее 20 секунд и кладёт текст в буфер обмена, улучшая Handy автоматом.
— Работать локально.
Запись никогда не уходит в облако: модели один раз скачиваются и дальше обрабатывают все на вашем компьютере. Важно для работы с NDA.
Установить просто — напишите своему агенту:
Установи скилл github.com/tonyprots/transcriber-skill.Если скилл поможет и вам, поддержите его звёздочкой на Github, мне будет приятно.
P.S. А видео выше собрано другим моим скиллом — о нем расскажу в следующий раз :)