1 paper
Xiao Ma, Zhiquan Hu, Yi Wei +6
Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hi…