🌀 Почему в некоторых случаях полезно обучать модель на данных, полученных… от другой модели
Обучение на предсказаниях другой модели — это основа подхода под названием knowledge distillation (дистилляция знаний). Идея в том, что сложная, тяжёлая модель (например, глубокая нейросеть) может содержать более «мягкую» и богатую информацию о структуре задачи, чем просто метки «0» и «1».
Маленькая модель, обучающаяся не на оригинальных метках, а на вероятностных предсказаниях большой модели, может:
➡️ лучше улавливать обобщённые закономерности,
➡️ достигать качества, близкого к исходной модели,
➡️ быть гораздо быстрее и легче в продакшене.
Это особенно полезно, когда требуется deploy в ограниченной среде (например, на мобильных устройствах), но не хочется терять в качестве. Получается, что модель может «учиться у другой модели», как ученик у учителя — и это работает.
Библиотека собеса по Data Science
Post #1051
810
- ❤ 5
- 👍 1