58 citations · 249 across the 58 of their papers we have counts for
1 paper · 2 filters
Heejin Do, Jaehui Hwang, Dongyoon Han +2
Evaluating large language models (LLMs) on final-answer correctness is the dominant paradigm. This approach, however, provides a coarse signal for model improvement and overlooks t…