Дистилляция нейронных сетей
Это процесс сокращения размера большой нейронной сети до более компактной формы, сохраняя ее высокую точность. Если говорить проще, то учим маленькую сеть имитировать поведение большой. Она полезна для ускорения работы сети на мобильных устройствах или встроенных системах, где ограничены ресурсы.
Примером может служить сеть VGG16, которая содержит более 138 миллионов параметров. После дистилляции ее размер можно уменьшить до 5 миллионов параметров без значительной потери точности.
Другой пример - дистилляция BERT, используемой для обработки естественного языка. Оригинальная модель содержит более 340 миллионов параметров, но после дистилляции ее размер можно уменьшить до 27 миллионов параметров, что позволяет эффективно использовать ее на мобильных устройствах.
Про процесс:
Суть в том, чтобы использовать не только истинные метки, но и выходы большой сети (teacher) для обучения меньшей сети (student), минимизируя разницу между их выходами.
Post #28
258

- 🔥 5
- ❤ 1