2 papers
cs.LG2026
Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference
Jiarui Hu, Zhiyuan Wen, Xiaoyun Liu +2
Large reasoning models often produce reasoning traces with verification, revision, and backtracking. When reflection merely re-checks established results, it wastes reasoning token…
cs.CL2026
When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation
Jiabin Shen, Guang Chen, Chengjun Mao
Top- teacher logits make on-policy distillation tractable, but retained teacher mass does not certify student-relative gradient fidelity. We study routed, two-teacher tool-use d…