1 paper
Ranxu zhang, zeyang li, Jiacheng Huang +5
Agentic reinforcement learning (Agentic RL) has achieved strong progress in tasks with clear success signals. However, many real-world agent applications require user-conditioned b…