1 paper · 1 filter
Shidong Yang, Ziyu Ma, Tongwen Huang +5
Large language model (LLM) agents are trained with reinforcement learning (RL) for complex decision-making tasks. However, most RL-trained agents remain episodic and cannot accumul…