1 paper
Jie Zhang, Cezara Petrui, Kristina NikoliÄ +1
Existing benchmarks for evaluating mathematical reasoning in large language models (LLMs) rely primarily on competition problems, formal proofs, or artificially challenging questio…