1 paper
Xue Wen Tan, Nathaniel Tan, Galen Lee +1
Evaluating the quality of reasoning traces from large language models remains understudied, labor-intensive, and unreliable: current practice relies on expert rubrics, manual annot…