1 paper · 1 filter
Ke Xu, Han Xu, Xinran Chen +6
Reinforcement learning for deep-search agents has largely focused on trajectory-level scoring -- outcome correctness, citation-aware rewards, and evidence coverage. Yet the actions…