1 paper · 1 filter
Yanfei Zhang, Xu Lin, Chenglin Wu
Reinforcement learning for multi-turn agents suffers from a credit-assignment mismatch: rewards are sparse and trajectory-level, while success often hinges on a few local decisions…