1 paper · 1 filter
Young-Jin Park, Kristjan Greenewald, Kaveh Alim +2
Process reward models (PRMs) play a central role in guiding inference-time scaling algorithms for large language models (LLMs). However, we observe that even state-of-the-art PRMs…