1 paper · 1 filter
Sraavya Sambara, Sung Eun Kim, Xiaoman Zhang +5
Current Vision-Language Models (VLMs) struggle to ground anatomical regions in 3D medical images and reason about them in a step-by-step manner, a key requirement of real-world dia…