1 paper
Shiyi Zhang, Mushui Liu, Yunze Tong +8
On-policy distillation (OPD), which leverages a pre-trained, specialized teacher model to provide dense supervisory signals, has achieved significant success in Large Language Mode…