1 paper · 1 filter
Peixuan Han, Runhui Wang, Ketan Ramaneti +3
Reinforcement learning with verifiable rewards (RLVR) has emerged as a powerful paradigm for large language model (LLM) post-training, but its reliance on coarse outcome rewards le…