Ну, вообще то все эти наши GPT обычно работают с текстом, а у нас аудио. Как быть?
Уже давно существует Whisper – нейронка от OpenAI, открытая и ускоренная так, что я прям на ноуте могу почти в реалтайме звук в текст переводить.
То есть процесс должен выглядеть так
Звук => Whisper => Текст => GPT с чеклистом в промпте => Репорт с анализом созвона
Магия, но нет. GPT путает фразы сотрудников и клиентов. Репорт получается с галлюцинациями.
Вывод? АААААА, GPT галлюцинирует, ее нельзя использовать в продакшн решениях, аааааааа
Ладно-ладно, вывод, что нужно вставить еще один этап – диаризацию. То есть отделить фразы одного человека от другого. Когда запись изначально сохранена в разных аудиодорожках файла, это делается тривиально. В моем случае это не так, так что в ход идет специальная заточенная на это нейронка.
Звук => (whisper + диаризация) => Текст с метками говорящих => GPT с чеклистом в промпте => Репорт с анализом созвона
Что может пойти не так? Качество перегонки в текст (speech_to_text или STT) на русском оказывается далеко от идеала. И диаризация все равно часто путает говорящих. Репорты с косяками, самое время грустить.
———
Тут те, кто следят за AI, скажут: "так это, нейронки уже давно мультимодальные, в них не обязательно только текст грузить, вон, у GPT давно уже картинки понимает, и вообще войсмод уже появился". И будет прав. Только вот войсмод не дает грузить записи, а хочет, чтобы ты в микрофон говорил. И стоит как крыло от самолета.
Помощь пришла откуда не ждали. Помните шутки про гугл, которые не может угнаться за OpenAI?
Так вот, у них давно уже нейронки не только с контекстом в 2 млн токенов вместо 128к у OpenAI, но и с поддержкой фото, аудио и видео на входе. Дада, можно загрузить видос с лекцией и сразу спрашивать по нему что-то без костылей с переводом в текст.
Чисто чтобы сравнить, я попросил выдать мне транскрипт аудио по ролям и получил результат на голову лучше, чем то что у меня было.
А так я в итоге я вообще отказался от текста и сразу задаю вопросы по аудио
Звук => Google Gemini с чеклистом в промпте => Репорт с анализом созвона
———
Я ожидал, что с OpenAI в каких-то случаях придется переключаться на Anthropic (основанный бывшими сотрудниками OpenAI), но вот гугл я вообще не ожидал, если честно
