1 paper
Nikhil Khani, Shuo Yang, Aniruddh Nath +9
Knowledge Distillation (KD) is a powerful approach for compressing a large model into a smaller, more efficient model, particularly beneficial for latency-sensitive applications li…