1 paper
Anubhav Khanal, Prabigya Acharya, Roshni Poudel +5
Vision-language models excel at 2D image understanding but remain limited in 3D spatial reasoning. Progress is hindered by limitations in current benchmarks. First, 3D datasets oft…