1 paper
Jiazhen Yuan, Zhike Gong, Jinquan Hang +2
Multi-step LLM agents in interactive environments represent a crucial step toward long-horizon decision-making. To train such agents, group-based reinforcement learning is widely a…