1 paper · 1 filter
Daniel R. Jiang, Ankur Samanta, Yukai Yang +3
Practical LLM agents often operate over multi-turn conversations where success is determined only after the full interaction ends. Most multi-turn RL methods train via on-policy ro…