1 paper · 1 filter
Brandon Ong, Tej Deep Pala, Vernon Toh +2
Process Reward Models (PRMs) provide step-level supervision that improves the reliability of reasoning in large language models. While PRMs have been extensively studied in text-ba…