Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback
Bin Chen, Xinye Liao, Yiming Liu +2
Recent LLM search agents use reinforcement learning with verifiable rewards (RLVR) to learn search-augmented reasoning from outcome rewards. On hard problems, these agents rarely s…
cs.AI2025
AdaptiveStep: Automatically Dividing Reasoning Step through Model Confidence
Yuliang Liu, Junjie Lu, Zhaoling Chen +10
Current approaches for training Process Reward Models (PRMs) often involve breaking down responses into multiple reasoning steps using rule-based techniques, such as using predefin…