language models 1open-ended generation 1policy optimization 1reward modeling 1self-evolving rubrics 1test-time reinforcement learning 1
From the 1 of 9 linked papers with an AI index.
Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning
Jianze Wang, Kunwang Zheng, Ying Liu +5
The paper introduces SERPO, a test-time reinforcement learning approach that lets language models self‑improve during inference by jointly evolving response evidence, query‑specifi…
cs.CL2024
MCSD: An Efficient Language Model with Diverse Fusion
Hua Yang, Duohai Li, Shiman Li
Transformers excel in Natural Language Processing (NLP) due to their prowess in capturing long-term dependencies but suffer from exponential resource consumption with increasing se…