1 paper · 1 filter
Hyunseok Lee, Soheil Abbasloo, Jihoon Tack +1
Reinforcement Learning with Verifiable Rewards (RLVR) has recently strengthened LLM reasoning, but its focus on final answer correctness leaves a critical gap: it does not ensure t…