1 paper · 1 filter
Shima Imani, Seungwhan Moon, Lambert Mathias +2
Reliable mathematical and scientific reasoning remains an open challenge for large vision-language models. Standard final-answer evaluation often masks reasoning errors, allowing s…