Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning
Qing Miao, Yiming Zhao, Jing Yang +5
Reinforcement Learning from Verifiable Rewards (RLVR) has recently become a key paradigm for improving the reasoning abilities of Large Language Models (LLMs), yet it remains limit…
cs.LG2024
Revisiting Generative Policies: A Simpler Reinforcement Learning Algorithmic Perspective
Jinouwen Zhang, Rongkun Xue, Yazhe Niu +4
Generative models, particularly diffusion models, have achieved remarkable success in density estimation for multimodal data, drawing significant interest from the reinforcement le…