В продолжение предыдущего тезиса.
Короче, я давно уже с ChatGPT сделал скрипт, который локально расшифровывал видеофайлы. Я даже делился им здесь, но мне этого было мало. Для некоторых задач я всё равно закидывал видео в ElevenLabs: там это происходило быстро, раскладывалось по спикерам, и таймкоды дробились по персонам. И я решил, что мне нужно такое же, но менее морочное в установке. И мы это вместе с Клодом сделали.
Итак, представляю Whisper Diarizer, название можно обсуждать.
Кидаешь файл (интервью, подкаст, материал с площадки — что угодно) — на выходе готовый текст с таймкодами, разбитый по репликам, и подписано, кто где говорит. Не сплошная простыня и не нарезка по 5 секунд, а реплика за репликой.
Встроенная расшифровка в Premiere и DaVinci — это, честно говоря, шляпа: путает слова, не понимает контекст, любые незнакомые слова превращаются в набор букв. Whisper на голову выше по качеству, особенно на русской речи с английскими терминами. Он реально их понимает как два языка и английский пишет латиницей.
Зачем это монтажёру:
— логировать отснятое, не пересматривая всё целиком;
— готовые субтитры — сразу экспорт в SRT, закидывается в Premiere/Resolve;
— искать нужный момент по тексту вместо перемотки;
— в длинном интервью спикеров можно переименовать в реальные имена, чтобы не путаться;
— потом это закидываешь в LLM, и получаешь выжимку тезисов или описание к видео.
Всё работает локально на компьютере — ничего никуда не заливается, никаких подписок. На GPU быстро, на CPU сильно медленнее, но тоже работает.
Как поставить:
1. Скачать:
github.com/zernovlab/Whisper-Diarizer2. Запустить
setup.bat — один раз, сам всё установит.
3. Запустить
run.bat4. Залогиниться на Hugging Face, чтобы получить доступ к моделям.
5. И дальше просто закидывать файлы.
Чтобы программа умела различать голоса, один раз нужно бесплатно зарегистрироваться на Hugging Face (это где лежат нужные модели) и на паре страниц нажать «разрешить доступ» — просто так эту модель не отдают, надо подтвердить, что вы не бот и согласны с условиями. Всё это займёт пару минут, все ссылки и что именно нажимать — прямо в самой программе при первом запуске, разберётся кто угодно.
Если регистрироваться не хочется — можно и без разделения по голосам, чистый текст с таймкодами тоже работает.
Короче, го тестировать, кто не сцыт!
Пробуйте, пишите, что не так и что доделать.