1 paper
Zelei Cheng, Amritansh Mishra, Sambit Sahu +1
Long-horizon tool-using agents must reason over user goals, domain policies, tool calls, simulator state, and delayed verifiable rewards. Reinforcement learning (RL) is a natural f…