1 paper · 1 filter
Shubham Parashar, Shurui Gui, Xiner Li +8
We aim to improve the reasoning capabilities of language models via reinforcement learning (RL). Recent RL post-trained models like DeepSeek-R1 have demonstrated reasoning abilitie…