Голосовой ввод без подписки, без интернета и под свои задачи
На прошлой неделе отменил подписку на голосовой ввод. При том, что пользуюсь им регулярно и считаю полезным — хоть к нему и надо привыкнуть. Просто оказалось, что то же самое есть в опенсорсе и работает не хуже. А если в чем-то и хуже — то это сегодня уже не проблема.
Дело даже не в подписке и не в том, что нужна стабильная связь с чьими-то серверами. Распознавание или вставка текста иногда не срабатывает, а причину не найти: код закрыт. Остается только писать в поддержку.
Заменил Aqua Voice на разработку Дмитрия Волова, которую он выложил в опенсорс, — AquaLocal. Механика такая же: зажал горячую клавишу, сказал, отпустил — текст встал в позицию курсора. Только распознавание идет на своей видеокарте, и аудио наружу не уходит. Конечно, есть требования к оборудованию: видеокарта NVIDIA от 4 ГБ.
Где печатаешь, там можно и диктовать — ввод работает в любом окне. Но часть сценариев Дмитрий сделал под себя: по одной горячей клавише надиктованное уходит заметкой в Obsidian, по другой — задачей в таск-менеджер. А мне нужно было свое.
Раньше в чужой код на незнакомом стеке не полез бы. А теперь дорабатываешь его вместе с агентом — и это уже не проблема. Сначала немного переделал интерфейс под свои предпочтения. Потом посерьезнее — сделал распознавание голосовых сообщений, которые шлю своему телеграм-боту.
Дмитрий все продумал, отладил и выдал рабочий инструмент. Делать такое с нуля точно не взялся бы, а подогнать готовое под себя получилось быстро.
Как-то писал, что иногда лучший код — это тот, который не был написан. И это не значит, что кода нет вовсе. Просто он может быть написан кем-то другим.
📄 Статья о разработке → https://volov.tech/blog/aqualocalvoiceinput
👉 Репозиторий → https://github.com/neo-flashman/aqualocal
Участвовали когда-нибудь в опенсорсе?
👍 — да, выкладывал свое или дописывал чужое
🔥 — нет, только пользуюсь готовым
🤔 — GitHub? Нет, не слышал
Post #185
4.35K
- 🔥 53
- 👍 32
- 🤔 5
- ✍ 4
- ❤ 3
- 😱 1
- 🤡 1