1 paper
Bin Chen, Xinye Liao, Yiming Liu +2
Recent LLM search agents use reinforcement learning with verifiable rewards (RLVR) to learn search-augmented reasoning from outcome rewards. On hard problems, these agents rarely s…