4 papers
INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval
Zhiwei Chen, Yupeng Hu, Zhiheng Fu +4
Composed Image Retrieval (CIR) is a challenging image retrieval paradigm that enables to retrieve target images based on multimodal queries consisting of reference images and modif…
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
Zixuan Li, Lei Meng, Guoqing Chao +5
Cross-modal alignment is an effective approach to improving visual classification. Existing studies typically enforce a one-step mapping that uses deep neural networks to project t…
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
Xiaoshuo Yan, Zhaochuan Li, Lei Meng +4
Causal inference has emerged as a promising approach to mitigate long-tail classification by handling the biases introduced by class imbalance. However, along with the change of ad…
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
Yuze Zheng, Zixuan Li, Xiangxian Li +4
Image classification models often demonstrate unstable performance in real-world applications due to variations in image information, driven by differing visual perspectives of sub…