1 paper · 1 filter
Jiangnan Xia, Yucheng Shi, Yu Yang +3
Reinforcement learning has become a key paradigm for eliciting reasoning abilities in large language models, where exploration is crucial for discovering effective solution traject…