1 paper
Huipeng Huang, Hongxin Wei
On-policy distillation (OPD) has emerged as an effective paradigm for transferring knowledge between language models, where a student is trained to align its next-token distributio…