1 paper
Chen Yang, Haiyuan Wan, Rengrong Xiong +2
On-policy distillation (OPD) has emerged as an effective framework for post-training language models by pairing student-generated trajectories with dense token-level supervision fr…