2 papers
cs.AI2026
Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
Chen Yang, Haiyuan Wan, Rengrong Xiong +2
On-policy distillation (OPD) has emerged as an effective framework for post-training language models by pairing student-generated trajectories with dense token-level supervision fr…
cs.AI2025
Long Term Memory: The Foundation of AI Self-Evolution
Xun Jiang, Feng Li, Han Zhao +12
Large language models (LLMs) like GPTs, trained on vast datasets, have demonstrated impressive capabilities in language understanding, reasoning, and planning, achieving human-leve…