1 paper
Xin Yu, Liuchen Liao, Yiwen Zhang +3
On-policy distillation is an efficient alternative to reinforcement learning, offering dense token-level training signals. However, its reliance on a stronger external teacher has…