2 papers
cs.CV2025
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
Zikui Cai, Andrew Wang, Anirudh Satheesh +10
Despite rapid advances in vision-language models (VLMs), current benchmarks for multimodal reasoning fall short in three key dimensions. First, they overwhelmingly rely on static i…
cs.CV2025
Evaluating Precise Geolocation Inference Capabilities of Vision Language Models
Neel Jay, Hieu Minh Nguyen, Trung Dung Hoang +1
The prevalence of Vision-Language Models (VLMs) raises important questions about privacy in an era where visual information is increasingly available. While foundation VLMs demonst…