1 paper · 1 filter
Taejong Joo, Diego Klabjan
Process reward models (PRMs) provide dense step-level guidance for search-based reasoning, enabling inference-time compute to be allocated toward promising partial solutions. Howev…