3 papers
cs.CV2026
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
Mingzhe Tao, Ruiping Liu, Junwei Zheng +6
Fusing sensors with complementary modalities is crucial for maintaining a stable and comprehensive understanding of abnormal driving scenes. However, Multimodal Large Language Mode…
cs.CV2025
On the Limitations of Vision-Language Models in Understanding Image Transforms
Ahmad Mustafa Anis, Hasnain Ali, Saquib Sarfraz
Vision Language Models (VLMs) have demonstrated significant potential in various downstream tasks, including Image/Video Generation, Visual Question Answering, Multimodal Chatbots,…
cs.CV2024
Activity Recognition on Avatar-Anonymized Datasets with Masked Differential Privacy
David Schneider, Sina Sajadmanesh, Vikash Sehwag +4
Privacy-preserving computer vision is an important emerging problem in machine learning and artificial intelligence. Prevalent methods tackling this problem use differential privac…