Команда технологий голосового ввода Яндекса придумала способ добавлять в умные устройства новые голосовые команды без забывания старых
Это классическая проблема непрерывного обучения, рассказали в ML Underhood. Чтобы устройство начало понимать новые команды, модель распознавания речи нужно дообучить. Но после обновления она может начать хуже распознавать знакомые фразы.
Стандартные методы вроде EWC пытаются удерживать параметры модели рядом с исходными значениями. Однако результат зависит от настройки ограничений, а гарантировать сохранение качества старых команд всё равно нельзя.
Исследователи Яндекса предложили другой подход — модульное расширение сети. Основную модель полностью замораживают, поэтому она продолжает отвечать за старые команды без изменений. Легковесные модули переиспользуют информацию из активаций старых слоёв и учатся распознавать новые команды. Поскольку параметры основной модели не меняются, качество старых команд сохраняется за счёт самой архитектуры, а не подбора настроек обучения.
Подход проверили на открытом наборе Google Speech Commands. В пяти отдельных экспериментах модель обучали распознавать новую пару команд, сохраняя поддержку восьми уже известных.
Средняя доля пропущенных новых команд снизилась с 6,46% до 4,37% по сравнению с отдельной моделью с тем же бюджетом дополнительных параметров. Модульное расширение также превзошло адаптеры и LoRA по качеству и количеству вычислений.
В результате получился практичный способ обновлять голосовые устройства с ограниченными ресурсами процессора и памяти: новые сценарии можно дополнять компактными модулями, не переобучая всю модель и не рискуя уже работающими функциями.
Статью Scalable Keyword Spotting via Modular Network Expansion приняли на Interspeech 2026. Конференция пройдёт с 27 сентября по 1 октября в Сиднее.
https://habr.com/ru/companies/yandex/articles/1061968
Post #9603
18.2K

- 🔥 47
- 😁 28
- ❤ 20
- 🗿 9
- ❤🔥 5
- 👍 5
- ☃ 2
- 😍 2
- 😭 2
- ⚡ 1