Человеческая речь бывает разной, и это знание заложено в работу искусственного интеллекта. Но как голосовому помощнику удаётся нас понимать?
Дело в том, что микрофон фиксирует колебания воздуха и преобразует их в электрический сигнал. Затем речь переводится в цифровой формат и разбивается на очень короткие фрагменты.
На этом этапе для помощника ещё нет готовой фразы вроде «поставь будильник на 8 утра». Есть только последовательность звуковых данных, в которой модель начинает искать закономерности.
Она сопоставляет особенности произношения с огромным количеством примеров речи и определяет, какие слова с наибольшей вероятностью соответствуют услышанному.
Это помогает справляться с разными вариантами произношения. Например, один и тот же звук может немного отличаться у разных людей, но модель учится распознавать общие закономерности.
📄 А если вы оговорились?
Например: «Поставь будильник на 7… на 8 утра».
Система не обязательно распознаёт это как отдельную команду «исправить 7 на 8». После «на 7» появляются дополнительные слова, которые меняют наиболее вероятную интерпретацию команды, поэтому итоговая команда распознаётся как «поставить будильник на 8 утра».
Голосовые технологии учатся на реальной человеческой речи, в которой есть и акценты, и оговорки.
А ваш голосовой помощник часто понимает вас с первого раза или приходится повторять по три раза?
