1 paper · 1 filter
Yuxin Zi, Cong Xu, Suparna Bhattacharya +2
While tool-augmented Large Language Models have significantly improved multi-step reasoning in quantitative STEM tasks, a critical residual failure mode remains: intermediate reaso…