1 paper · 1 filter
Junlong Ke, Zichen Wen, Weijia Li +2
On-policy self-distillation trains a reasoning model on its own rollouts while a teacher, often the same model conditioned on privileged context, provides dense token-level supervi…