1 paper · 1 filter
Xingjian Tao, Yiwei Wang, Yujun Cai +1
Multi-view spatial reasoning requires vision-language models to compare visual evidence across images, align object correspondences, and infer spatial relations over long visual co…