Один из самых моих полезных проектов был - доработка и переработка "первого ИИ-диктофона" Plaud.
На день рождения моя команда подарила мне это замечательное устройство. Это просто огненный секси-девайс. Тонкий, нормальная автономная работа, шикарное качество корпуса, крепится к телефону на магните. Ну просто огонь.
Единственный минус - он хорош тогда, когда вы подключаете платную подписку Plaud.
Вы нажимаете кнопку, и устройство начинает записывать, далее оно расшифровывает речь, запоминает, где ваш голос, а где не ваш, делает саммари. В общем, крутое современное устройство.
Но я ненавижу привязку к подпискам. Поэтому ушёл со всяких облачных хранилищ и прочих сервисов. То есть устройство почти бесполезно без подписки. Хорошая бизнес-модель. Как и дебильная Алиса.
Но я решил всё-таки сделать суверенный плауд.
1. Надо было научиться подключаться к самому устройству. Подключение к устройству зашифровано. Но если поймать код, который передаётся на сервер в оригинальном приложении, то уже можно подключиться самостоятельно с любого устройства.
2. Далее все записи хранятся в шифрованном виде. Вот здесь пришлось попотеть, чтобы найти, как оригинальное приложение расшифровывает записи. Кратко - есть некий код, который зашивается в сами ogg на устройстве, и если узнать последовательность, то можно получать расшифрованную запись.
3. А затем нужно создать инфраструктуру для расшифровки звука в текст, саммаризации текста, диаризации (распознавания, кто говорит), ну и далее - на свободный полёт фантазии, например, выставлять задачи по итогу обсуждений.
Я начал с создания прям красивого приложения. Очень я люблю, чтобы даже мои драфтовые наработки были с красивым интерфейсом. Вдохновившись дизайном Teenage Engineering, сделал приложение, которое подключается к устройству и сразу скачивает с устройства все не скачанные записи.
Далее приложение эти записи отправляет на мой приватный сервер (физический сервер, про который я рассказывал ранее). Далее сначала смотрится, где есть речь, запись расшифровывается в текст, и параллельно с этим сервер ищет голоса знакомых людей. Каждый раз, если звучит новый, неизвестный ему голос, в приложении можно вписать имя.
Затем из полученной расшифровки с указанными людьми происходит создание саммаризации.
Самое прикольное, что формат можно создавать абсолютно любой. Можно даже на каждый тип встреч (а тип определяется по контексту: созвон, личное, голосовая заметка, надиктованный пост, встреча команды и т. д.) создавать свой тип саммари, экшнайтемов, отправлять задачи, которые я не буду смотреть. А далее созданный саммари появляется в моём Obsidian.
Если мне нужно прослушать запись, я для себя выбрал самый крутой нейросетевой шумодав и интегрировал его внутрь - и для прослушивания можно всегда иметь под рукой чистую запись.
В общем, получился действительно крутой проект. Я параллельно сделал для себя ещё копию приложения, но только работающую с микрофоном телефона - устройство не нужно, и всё работает идентично. Но всё-таки люблю этот маленький красивый диктофон.
Спасибо за этот прекрасный подарок!
Post #551
337