Локальный Виспер без питонга.
Продолжение нашего вчерашнего разговора про транскрибацию с помощью ChatGPT.
У кого нет ChatGPT или у кого аллергия на ChatGPT, можно пользоваться вот такой вот штукой.
Это полностью локальная транскрибация звука на вашем компе.
Есть клиент для Винды, для Мака и для Линукса. И всё это скачивается вот по этой ссылке.
https://sourceforge.net/projects/buzz-captions/files/
Для Винды не подписано, Винда будет бессильно ругацца.
Для тех, кто хочет в код, есть ссылка и на код.
https://github.com/chidiwilliams/buzz
Для меня тут основная новая фишка - это то, что он умеет выводить субтитры и различать говорящих, а также принимать на вход видеофайлы.
И да, там есть CUDA и MLX ускорение.
Полный список фич:
- Транскрибация аудио- и видеофайлов, а также видео по ссылкам YouTube
- Транскрибация аудио в реальном времени с микрофона
- Отдельное окно для отображения текста во время мероприятий и презентаций
- Разделение речи перед транскрибацией для повышения точности на записях с шумом
- Определение говорящих в транскрибированных аудио и видео
- Поддержка нескольких бэкендов Whisper
- CUDA-ускорение на видеокартах NVIDIA
- Поддержка Apple Silicon на Mac
- Vulkan-ускорение Whisper.cpp на большинстве GPU, включая встроенную графику
- Поддержка нескольких семейств моделей Transformer через Hugging Face в режиме Whisper
- Экспорт транскрипций в TXT, SRT и VTT
- Расширенный просмотрщик транскрипций с поиском, управлением воспроизведением и регулировкой скорости
- Горячие клавиши для быстрой навигации
- Отслеживаемая папка (Watch Folder) для автоматической транскрибации новых файлов
- Интерфейс командной строки (CLI) для скриптов и автоматизации
- Система плагинов, включая AI-суммаризацию и автоматическое изменение размера/форматирования транскриптов
@cgevent
Post #16782
3.56K

- 🔥 15
- 👎 3
- ❤ 2
- 👍 2