2 papers
cs.CV2026
Medical Image Spatial Grounding with Semantic Sampling
Andrew Seohwan Yu, Mohsen Hariri, Kunio Nakamura +3
Vision language models (VLMs) have shown significant promise in visual grounding for images as well as videos. In medical imaging research, VLMs represent a bridge between object d…
cs.LG2026
A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning
Pegah Ahadian, Mingrui Yang, Sixu Chen +2
Knee osteoarthritis frequently exhibits discordance between structural damage observed in imaging and patient-reported symptoms such as pain. This mismatch complicates clinical int…