1 paper
Sraavya Sambara, Sung Eun Kim, Xiaoman Zhang +5
Current Vision-Language Models (VLMs) struggle to ground anatomical regions in 3D medical images and reason about them in a step-by-step manner, a key requirement of real-world dia…