language models 1open-ended generation 1policy optimization 1reward modeling 1self-evolving rubrics 1test-time reinforcement learning 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.CL2026
SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
Jianze Wang, Kunwang Zheng, Ying Liu +5
The paper introduces SERPO, a test-time reinforcement learning approach that lets language models self‑improve during inference by jointly evolving response evidence, query‑specifi…
cs.AI2026
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
Yunhan Bu, Quan Zhang, Huaping Zhang +9
Multi-Hop Fact Verification requires complex reasoning across disparate evidence, posing significant challenges for Large Language Models , which may suffer from hallucinations and…
cs.CL2026
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
Jianze Wang, Ying Liu, Jinlong Chen +7
On-policy distillation (OPD) trains a student on its own trajectories under token-level teacher supervision, but existing methods are capped by a single-teacher capability ceiling:…