1 paper
Ximo Zhu, Ruiqi Liu, Rong Wang +8
On-policy distillation (OPD) applies token-level teacher supervision to student-generated trajectories, but this supervision is not always reliable. Existing methods use local conf…