1 paper · 1 filter
Li Jiang, Haoran Xu, Yichuan Ding +1
On-policy distillation (OPD) has become a central post-training tool for large language models (LLMs), providing dense per-token teacher supervision along the student's own rollout…