1 paper · 1 filter
Zibin Meng, Peng Xie, Kani Chen
Reinforcement learning (RL) has become the dominant paradigm for improving the reasoning capabilities of large language models, but it requires expensive training, curated data, an…