1 paper
Xiao Ma, Zhiquan Hu, Yi Wei +5
Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hi…