Исследователи Санкт-Петербургского федерального исследовательского центра РАН научились при помощи алгоритмов искусственного интеллекта и «компьютерного зрения» распознавать речь человека по губам. Разработка поможет повысить точность работы голосовых помощников в шумных условиях.
В основе приложения лежит нейросетевая модель, которую научили распознавать по аудиовизуальным сигналам несколько сотен наиболее распространённых команд. Причём, по словам учёных, созданная нейросеть способна воспринимать аудиовизуальный сигнал и автоматически принимать решение о том, какие данные (видео или звук, или оба) при распознавании дадут максимальную точность.
В ходе экспериментов приложение использовалось водителями шумных большегрузных автомобилей одной из логистических компаний России. Для этого ПО было установлено на смартфоны испытуемых. Точность распознавания команд только по визуальным эффектам составила 60-80%, а в комбинации со звуковым сигналом – более 90%.
Проект по разработке данного программного обеспечения является частью большой работы учёных СПб ФИЦ РАН по созданию специализированных систем автоматического распознавания речи. Например, ранее исследователи разработали интеллектуальную систему, помогающую врачам общаться с глухими пациентами.
Источник.
#искусственныйинтеллект
Post #370
100
- 👍 1