1 paper
Jinghan Li, Junfeng Fang, Jinda Lu +5
Reinforcement Learning with Verifiable Rewards (RLVR) and Group Relative Policy Optimization (GRPO) have significantly advanced the reasoning capabilities of large language models.…