Расшифровка аудио и видео для редактора
Редакторам часто приходится расшифровывать длинные аудио и видео, и в чате наши подписчики предложили три варианта, как это можно делать.
1. Google AI Studio. Настраивать не нужно: загружаешь файл — получаешь текст. Бесплатный лимит в подписке заканчивается быстро, дальше сервис становится платным.
2. Whisper, поднятый локально или на своём сервере. Бесплатно, но упирается в железо — оно может не потянуть Whisper. Этот вариант сработал в итоге не у всех, например, у одного из подписчиков большие документы качались криво, а Whisper при этом сильно тормозил.
3. Платный сервис Riverside: скормил аудио, через пару минут забрал расшифровку и отдал её агенту в работу. Хорошо работает с русским языком.
Один из подписчиков собрал себе скилл для Клода на локальном Whisper, который расшифровывает запись и отсеивает типовые ошибки.
→ Скилл лежит в открытом доступе на GitHub: claude-transcribe.
Расшифровка, разбивка по ролям и чистка транскрипта идут локально, а тип записи и мемо определяет Claude. Возможно, эту часть получится поручить локальным моделям вроде Qwen, но качество ещё нужно проверить. Вот что умеет скилл:
— Определяет язык записи, а Claude — её тип: созвон, интервью, лекция или голосовая заметка.
— Отделяет речь от тишины с помощью Silero VAD и локально расшифровывает её через Whisper с таймкодами.
— Защищается от типовых галлюцинаций Whisper: пропускает длинную тишину, удаляет известные ложные фразы и позволяет повторно расшифровать подозрительные фрагменты, например зацикленные, после обработки звука.
— Детерминированно чистит транскрипт от междометий, речевых паразитов и повторов, не переписывая его через Claude.
— В диалогах автоматически определяет число спикеров, разбивает текст по репликам и просит пользователя назвать найденные голоса.
— Claude составляет мемо по шаблону записи и встроенным редакторским правилам: без домыслов, канцелярита и нейросетевых штампов.
— Готовый документ проходит типографскую обработку и сохраняется рядом с исходной записью.
В скилл встроен наш Мильчин и адаптированы идеи Слопотрона и Чуковского. Приём здесь шире простой расшифровки: всё механическое делает скрипт, а модель подключается только там, где нужно понимание, — чтобы определить тип записи и написать мемо. Поэтому ей не приходится переписывать исходный текст.
Пользуйтесь!
Post #59
84