2 papers
cs.AI2026
Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
Wenhao Zhang, Yibo Xie, Rui Wang +9
Autoregressive rollout generation is a major computational cost in reinforcement learning for large language models. Reusing each rollout batch for additional learner updates amort…
cs.AI2026
UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention
Cheng Yan, Guangyang Ye, Wuyang Zhang +5
While test-time scaling improves the problem-solving ability of large reasoning models (LRMs) through additional inference-time computation, it can also exacerbate overthinking and…