1 paper
Guibin Zhang, Jiayang Lyu, Ran Sun +4
Enabling agents to learn from experience and internalize it into their policy has become a central problem in self-evolving AI. On-policy self-distillation (OPSD) offers an effecti…