1 paper · 1 filter
Ali Åenol, Garima Agrawal, Huan Liu
Despite remarkable progress on reasoning benchmarks, current LLM evaluation practice remains anchored to final-answer correctness, providing limited insight into how models reason,…