3 citations · 3 across the 3 of their papers we have counts for
1 paper · 1 filter
Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang +3
Vision Language Models (VLMs) demonstrate strong perceptual abilities but remain limited in tasks requiring analytical reasoning across multiple visual states, such as multi-image…