1 paper · 1 filter
Yongjae Lee, Taekhyun Park, Sunghyun Sim +1
Recent advances in sparse reward policy gradient methods have enabled effective reinforcement learning (RL)-based language model post-training. However, for reasoning tasks such as…