1 paper
Deyu Zou, Yongqiang Chen, Fan Feng +4
Reinforcement learning (RL) has become a de facto paradigm for building LLM-based agents that act, interact, and reason over extended task horizons. However, in active reasoning wh…