1 paper · 1 filter
Wen Ye, Yuxiao Qu, Aviral Kumar +1
Unlike large language models (LLMs) that exhibit strong reasoning capabilities, vision-language models (VLMs) struggle with visual reasoning, even on geometry problems that admit e…