1 paper
Zhaohui Yang, Chenghua He, Xiaowen Shi +4
Many studies focus on data annotation techniques for training effective PRMs. However, current methods encounter a significant issue when applied to long CoT reasoning processes: t…