Цифровой алкотестер: как нейросеть вычисляет опьянение по голосу
Пара фраз — и машина поймет: за руль нельзя. Ученые уже учат нейросети отличать пьяную речь по нескольким фразам. Звучит как фантастика? Уже нет. Разбираемся, как это работает и при чем тут немецкие скороговорки.
🍾 Как речь выдает опьянение
Машины, которые определяют опьянение и блокируют запуск, — это уже не фантастика, а сегодняшний день. С 2019 года в Евросоюзе все новые автомобили выпускаются с расчетом на установку «алкозамка».
Что, если машина сможет определять опьянение без всякой трубки, просто слушая голос? Алкоголь неизбежно меняет речь, ведь говорение — это сложнейшая работа сотни мышц, синхронизированных мозгом. Голос меняется — это заметно даже на слух, а уж алгоритмы диагностики давно это умеют. Осталось перенести эту технологию в автомобиль.
🍾 Корпус пьяной речи
Еще в 2011 году на научном конкурсе Interspeech 2011: Speaker State Challenge исследователи задумались об алгоритме, который был бы способен претворить эту идею в жизнь, и создали датасет Alcohol Language Corpus (ALC). Ученые зафиксировали, что у выпивших (особенно женщин) часто повышалась тональность голоса. Но обобщить другие акустические особенности тогда не удалось.
Позже итальянские ученые продолжили исследования, применив нейросети. Они использовали тот же датасет ALC, сосредоточившись на скороговорках, которые оказались особенно чувствительны к алкоголю. Затем они перешли к созданию модели, способной игнорировать уникальность каждого голоса.
🍾 Как устроен нейросетевой алкотестер
DANN — это архитектура нейросети, которая учится выделять инвариантные признаки, то есть такие, которые не зависят от особенностей данных. Например, такая модель будет игнорировать разные стили речи и индивидуальные черты говорящих — вместо этого она сосредоточится именно на том, чтобы выявить факт употребления алкоголя.
• Один блок извлекает из входных аудиозаписей общие признаки опьянения (тон, ритм).
• Второй блок классифицирует речь как трезвую или нетрезвую.
• Третий блок (контролер) пытается угадать личность говорящего. Если это удается, первый блок «штрафуется», чтобы алгоритм отфильтровывал индивидуальные особенности и фокусировался только на изменениях от алкоголя.
Модель обучили на 75% данных ALC и протестировали на оставшихся записях. Она показала точность почти 71% на новых голосах, став важным шагом к созданию универсального голосового алкотестера.
О том, как формировался корпус пьяной речи и других деталях исследований, читайте в полной статье.
🤖 «Системный Блокъ» @sysblok
Post #1354
3.69K
- 🍾 24
- 🔥 13
- ❤ 7
- 🙈 6
- 👏 3