1 paper
Yiran Ma, Zui Chen, Tianqiao Liu +4
Step-level reward models (SRMs) can significantly enhance mathematical reasoning performance through process supervision or step-level preference alignment based on reinforcement l…