4 papers
Cross-Modal Mapping: Mitigating the Modality Gap for Few-Shot Image Classification
Xi Yang, Pai Peng, Wulin Xie +2
Few-shot image classification remains a critical challenge in the field of computer vision, particularly in data-scarce environments. Existing methods typically rely on pre-trained…
Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment
Wulin Xie, Rui Dai, Ruidong Ding +4
Image Quality Assessment (IQA) predicts perceptual quality scores consistent with human judgments. Recent RL-based IQA methods built on MLLMs focus on generating visual quality des…
Task-Augmented Cross-View Imputation Network for Partial Multi-View Incomplete Multi-Label Classification
Lian Zhao, Jie Wen, Xiaohuan Lu +3
In real-world scenarios, multi-view multi-label learning often encounters the challenge of incomplete training data due to limitations in data collection and unreliable annotation…
Multimodal Fusion on Low-quality Data: A Comprehensive Survey
Qingyang Zhang, Yake Wei, Zongbo Han +8
Multimodal fusion focuses on integrating information from multiple modalities with the goal of more accurate prediction, which has achieved remarkable progress in a wide range of s…