1 paper · 1 filter
Rongcan Pei, Zhepei Wei, Shuyao Xu +3
On-Policy Self-Distillation (OPSD) has emerged as a popular paradigm for large language model (LLM) self-improvement, allowing models to act as their own teachers by leveraging pri…