TGViewer
AI и грабли AI и грабли @oestick · 13.7K subscribers
Post #225 901
Я тут недавно офигел, до чего техника дошла. Прилетает задача по анализу созвонов с клиентами компании. Есть записи, есть список критериев для анализа, чего не хватает?

Ну, вообще то все эти наши GPT обычно работают с текстом, а у нас аудио. Как быть?

Уже давно существует Whisper – нейронка от OpenAI, открытая и ускоренная так, что я прям на ноуте могу почти в реалтайме звук в текст переводить.

То есть процесс должен выглядеть так

Звук => Whisper => Текст => GPT с чеклистом в промпте => Репорт с анализом созвона


Магия, но нет. GPT путает фразы сотрудников и клиентов. Репорт получается с галлюцинациями.

Вывод? АААААА, GPT галлюцинирует, ее нельзя использовать в продакшн решениях, аааааааа

Ладно-ладно, вывод, что нужно вставить еще один этап – диаризацию. То есть отделить фразы одного человека от другого. Когда запись изначально сохранена в разных аудиодорожках файла, это делается тривиально. В моем случае это не так, так что в ход идет специальная заточенная на это нейронка.

Звук => (whisper + диаризация) => Текст с метками говорящих => GPT с чеклистом в промпте => Репорт с анализом созвона


Что может пойти не так? Качество перегонки в текст (speech_to_text или STT) на русском оказывается далеко от идеала. И диаризация все равно часто путает говорящих. Репорты с косяками, самое время грустить.

———

Тут те, кто следят за AI, скажут: "так это, нейронки уже давно мультимодальные, в них не обязательно только текст грузить, вон, у GPT давно уже картинки понимает, и вообще войсмод уже появился". И будет прав. Только вот войсмод не дает грузить записи, а хочет, чтобы ты в микрофон говорил. И стоит как крыло от самолета.

Помощь пришла откуда не ждали. Помните шутки про гугл, которые не может угнаться за OpenAI?

Так вот, у них давно уже нейронки не только с контекстом в 2 млн токенов вместо 128к у OpenAI, но и с поддержкой фото, аудио и видео на входе. Дада, можно загрузить видос с лекцией и сразу спрашивать по нему что-то без костылей с переводом в текст.

Чисто чтобы сравнить, я попросил выдать мне транскрипт аудио по ролям и получил результат на голову лучше, чем то что у меня было.

А так я в итоге я вообще отказался от текста и сразу задаю вопросы по аудио

Звук => Google Gemini с чеклистом в промпте => Репорт с анализом созвона


———

Я ожидал, что с OpenAI в каких-то случаях придется переключаться на Anthropic (основанный бывшими сотрудниками OpenAI), но вот гугл я вообще не ожидал, если честно
  • 👍 7
  • ❤ 6
  • 🔥 3
More from @oestick
  1. Oct 4, 2026Саша Поляков собрал стату по банам (меня тоже в этот раз задело). Мб кому-то полезно будет…
  2. Oct 4, 2026Собрал статистику по банам Claude из комментариев в канале Пост с разбором телеметрии, кот…
  3. Oct 2, 2026О, мой баг репорт в getbb.app приняли. Приятно быть причастным к развитию того, чем сам по…
  4. Oct 1, 2026А у вас тоже есть задачки, в которых нужно очень много и глубоко думать, но вы их откладыв…
  5. Sep 30, 2026Anthropic > OpenAI, но есть пара но Предпосылки 1. opus-5.5 очень хорош 2. DevDay openai –…
  6. Sep 27, 2026Скоро: видео-монтаж-слоп во всех лентах страны Opus-5.5 теперь сам такое ваншотит на remot…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →