1 paper · 1 filter
Wenjie Tang, Minne Li, Sijie Huang +2
Reinforcement learning from verifiable rewards (RLVR) is a promising paradigm for improving large language model (LLM) agents on long-horizon interactive tasks. However, in partial…