1 paper · 1 filter
Hong Wang, Zhezheng Hao, Jian Luo +6
Using Reinforcement Learning with Verifiable Rewards (RLVR) to optimize Large Language Models (LLMs) can be conceptualized as progressively editing a query's `Reasoning Tree'. This…