1 paper · 1 filter
Jiazhen Yuan, Zhike Gong, Jinquan Hang +2
Multi-step LLM agents in interactive environments represent a crucial step toward long-horizon decision-making. To train such agents, group-based reinforcement learning is widely a…