4 papers
SatireDecoder: Visual Cascaded Decoupling for Enhancing Satirical Image Comprehension
Yue Jiang, Haiwei Xue, Minghao Han +5
Satire, a form of artistic expression combining humor with implicit critique, holds significant social value by illuminating societal issues. Despite its cultural and societal sign…
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
Xu Zheng, Haiwei Xue, Jialei Chen +6
Simultaneously using multimodal inputs from multiple sensors to train segmentors is intuitively advantageous but practically challenging. A key challenge is unimodal bias, where mu…
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu +7
Retrieval-augmented generation (RAG) has emerged as a pivotal technique in artificial intelligence (AI), particularly in enhancing the capabilities of large language models (LLMs)…
MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation
Chenfei Liao, Xu Zheng, Yuanhuiyi Lyu +5
Research has focused on Multi-Modal Semantic Segmentation (MMSS), where pixel-wise predictions are derived from multiple visual modalities captured by diverse sensors. Recently, th…