1 paper
Ali Şenol, Garima Agrawal, Huan Liu
Despite remarkable progress on reasoning benchmarks, current LLM evaluation practice remains anchored to final-answer correctness, providing limited insight into how models reason,…