Новый алгоритм, получивший название CA-SER, построен на базе парадигмы самообучения (SSL) и объединяет в себе сразу несколько подходов, которые сегодня активно используются при анализе устной речи и для распознавания эмоций.
Система сначала выделяет ключевые особенности речи, а затем дополняет их данными о громкости и тональности звуков, учитывая восприятие человеком разных частей аудиоспектра. Эти типы информации объединяются специальным механизмом, что улучшает точность определения эмоций.
Исходный код модели доступен в открытом виде, поэтому другие ученые могут использовать инструмент в своих исследованиях, чтобы провести дополнительные эксперименты для проверки работы модели с другими языками и датасетами, повысить ее универсальность и применимость в реальных условиях. Так, модель можно обучать на русскоязычных эмоциональных корпусах и затем применять в голосовых помощниках и контакт-центрах
— говорится в сообщении.
Результаты показали, что российская разработка превосходит большинство аналогов и сравнима с трансформером HuBERT от Meta (признана экстремистской и запрещена в РФ). Ученые рассчитывают, что это поможет улучшить работу голосовых помощников и других систем, распознающих эмоции.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
#новостьдня
