1 paper · 1 filter
Hongbo Jin, Rongpeng Zhu, Zhongjing Du +4
Reinforcement learning is crucial for aligning large language models to perform complex reasoning tasks. However, current algorithms such as Group Relative Policy Optimization suff…