1 paper
Salman Rahman, Sruthi Gorantla, Arpit Gupta +3
Process reward models (PRMs) that provide dense, step-level feedback have shown promise for reinforcement learning, yet their adoption remains limited by the need for expensive ste…