1 paper · 1 filter
Ziqi Zhao, Zhaochun Ren, Jiahong Zou +9
Reinforcement learning with verifiable rewards (RLVR) has proven effective in enhancing the reasoning of large language models (LLMs). Monte Carlo Tree Search (MCTS)-based extensio…