1 paper · 1 filter
Xin Li, Hao Jiang, Annan Wang +2
On-policy distillation (OPD) is widely used for LLM post-training. When pushed with a reward-extrapolation coefficient lambda > 1, the student can lift past the teacher in domain,…