2 papers
cs.HC2026
A Brief Overview: On-Policy Self-Distillation In Large Language Models
Fangming Cui, Sunan Li, Jiahong Li
On-Policy Self-Distillation (OPSD) is a unified learning framework in which a single large language model acts simultaneously as both teacher and student. Unlike conventional knowl…
cs.AI2026
Rethinking Agentic Reinforcement Learning In Large Language Models
Fangming Cui, Ruixiao Zhu, Cheng Fang +2
Reinforcement Learning (RL) has traditionally focused on training specialized agents to optimize predefined reward functions within narrowly defined environments. However, the adve…