1 paper · 1 filter
Lei Gao, Zhuoming Li, Mengxi Jia +4
Existing reinforcement learning approaches for Large Language Models typically perform policy optimization at the granularity of individual tokens or entire response sequences. How…