2 papers
cs.CV2026
Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
Yuliang Cai, Dongqiangzi Ye, Zitian Chen +1
Autonomous driving increasingly relies on Visual Question Answering (VQA) to enable vehicles to understand complex surroundings by analyzing visual inputs and textual queries. Curr…
cs.CV2025
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
Yuliang Cai, Jesse Thomason, Mohammad Rostami
Vision-language models (VLMs), such as CLIP, have demonstrated strong performance across a range of downstream tasks. However, CLIP is still limited in negation understanding: the…