1 paper
Chi-Ping Su, Ching-Hsun Tseng, Bin Pu +4
Knowledge distillation (KD) enables a smaller "student" model to mimic a larger "teacher" model by transferring knowledge from the teacher's output or features. However, most KD me…