1 paper
Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski +1
Knowledge distillation (KD) transfers capabilities from large language models (LLMs) to smaller students, yet it can fail unpredictably and also underpins model leakage risks. Our…