1 paper · 1 filter
Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu +6
Large vision-language models have achieved strong performance in multimodal reasoning, but they remain unreliable on fine-grained spatial tasks that demand both precise spatial per…