(это когда модель не обучают чему то, а просто дают зубрить правильные ответы. в итоге модель знает правильные ответы, но может часто начинать сама себе доказывать правильность своих утверждений, потому что не понимает природы этих выводов. Если ваша модель начинает выдвигать правильные тезисы а потом пытаться доказать себе что они верные - это прямо указывает на дистиляцию)
Ну короче получается еще дешевле чем 3.7 и по классике быстрее, выше, сильнее.