Решение содержит 219 млн параметров, что приблизительно в пять раз меньше, чем у исходной модели (около 1 млрд параметров). При этом она работает примерно в 10 раз быстрее, а отклонение по точности составляет менее 1%.
❗️Такие решения могут позволить обрабатывать большие объёмы аудио на существующей инфраструктуре без пропорционального увеличения числа серверов.
Результат достигнут за счёт метода дистилляции знаний — подхода, при котором большая обученная нейросеть становится «учителем» для более компактной модели. Она передаёт ей не только правильные ответы, но и оценку степени своей уверенности в каждом варианте.
Разработка может использоваться у операторов связи, технической поддержки и транснациональных компаний, где аудиопотоки исчисляются миллионами записей.
«Модель анализирует акустические и фонетические особенности речи, извлекая их напрямую из аудиосигнала. Результат идентификации указывается в виде стандартизированных языковых кодов (rus, eng и т.д.), что упрощает использование решения в конвейерах обработки данных по распознаванию речи», — отмечает Александр Самойлов, исследователь направления обработки аудиоданных в «Криптоните».
📣 Подробности читайте на нашем сайте. #новости_Криптонит
