1 paper · 1 filter
Yuhan Chen, Yuxuan Liu, Long Zhang +3
Multi-turn interaction remains challenging for online reinforcement learning. A common solution is trajectory-level optimization, which treats each trajectory as a single training…