Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration
Mingtao Xian, Yifeng Yang, Qinying Gu +2
Multimodal Large Language Models (MLLMs) have shown strong performance in multi-image cross-modal retrieval, yet suffer from severe position bias, where predictions are dominated b…
cs.CV2026
TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection
Yifeng Yang, Jubo Feng, Jing Xu +3
Vision-language models enable OOD detection by comparing image alignment with ID labels and negative semantics. Existing negative-label-based methods mainly rely on static negative…
cs.CV2025
: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization
Lin Zhu, Yifeng Yang, Xinbing Wang +2
Recent approaches for vision-language models (VLMs) have shown remarkable success in achieving fast downstream adaptation. When applied to real-world downstream tasks, VLMs inevita…