1 paper · 1 filter
Yanning Hou, Haoyuan Chen, Sihang Zhou +7
Reinforcement learning (RL) search agents commonly model retrieval as free-form natural-language query generation and optimize multi-turn interactions using final-answer rewards. C…