1 paper · 1 filter
Xue Wen Tan, Nathaniel Tan, Galen Lee +1
Evaluating the quality of reasoning traces from large language models remains understudied, labor-intensive, and unreliable: current practice relies on expert rubrics, manual annot…