2 papers
cs.AI2026
Calibrating Teacher--Student Discrepancy for On-Policy Distillation
Qiangqiang He, Jin Li, MingCai Chen
On-policy distillation (OPD) improves reasoning models by learning the token-level discrepancy between a stronger teacher and an on-policy student. However, this discrepancy does n…
cs.AI2026
Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
Qiangqiang He, Zhongheng Wu, ZiJian Wang
Reinforcement learning with verifiable rewards (RLVR) is central to improving long-CoT reasoning in large language models. Critic-free methods such as GRPO convert response-level r…