3 papers
cs.LG2026
T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning
Bo-Wen Zhang, Junwei He, Maoqi Liu +6
Reinforcement learning enables large language model (LLM) agents to learn multi-step behaviors through interaction with their environments. However, rewards in many interactive tas…
cs.LG2026
Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics
Maoqi Liu, Junwei He, Bowen Zhang +5
Rubric-based reinforcement learning (Rubric-RL) trains language models where no verifier exists. A judge checks each criterion of a rubric, and the verdicts are aggregated into a r…
cs.AI2026
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
Bo-Wen Zhang, Junwei He, Wen Wang +5
Rubric-based reinforcement learning enriches language model training by evaluating model outputs against explicit criteria. Yet in GRPO-style pipelines, these structured judgments…