1 paper · 1 filter
Yuhan Li, Mingxu Zhang, Dazhong Shen +1
On-policy self-distillation (OPSD) trains a reasoning model on rollouts sampled from its own policy by matching a privileged teacher that also sees verified reference solutions. Ex…