1 paper
Tianyang Luo, Tao Feng, Zhigang Hua +4
Reinforcement learning has emerged as a powerful paradigm for improving large language model (LLM) reasoning, where rollouts are sampled from the policy and reward signals computed…