1 paper
Muku Akasaka, Soyeon Caren Han
Visual spatial reasoning (VSR) remains challenging for modern vision-language models (VLMs), despite advances in multimodal architectures. A common strategy is to inject additional…