1 paper · 1 filter
Jianze Wang, Ying Liu, Jinlong Chen +7
On-policy distillation (OPD) trains a student on its own trajectories under token-level teacher supervision, but existing methods are capped by a single-teacher capability ceiling:…