5 papers
MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems
Quanxing Xu, Yuhao Tian, Ling Zhou +4
Visual Question Answering (VQA), as the representative multimodal task, serves as a key benchmark for evaluating the reasoning capabilities of Multimodal Large Language Models (MLL…
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
Quanxing Xu, Ling Zhou, Xian Zhong +3
With advances in multimodal research and deep learning, Multimodal Large Language Models (MLLMs) have emerged as a powerful paradigm for a wide range of multimodal tasks. As a core…
PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention
Maoheng Li, Ling Zhou, Xiaohua Huang +3
Multimodal sarcasm detection, which aims to precisely identify pragmatic incongruities between literal text and nonverbal cues, has gained substantial attention in multimodal under…
Incorporating Scene Context and Semantic Labels for Enhanced Group-level Emotion Recognition
Qing Zhu, Wangdong Guo, Qirong Mao +3
Group-level emotion recognition (GER) aims to identify holistic emotions within a scene involving multiple individuals. Current existed methods underestimate the importance of visu…
A Survey of Deep Learning for Group-level Emotion Recognition
Xiaohua Huang, Jinke Xu, Wenming Zheng +2
With the advancement of artificial intelligence (AI) technology, group-level emotion recognition (GER) has emerged as an important area in analyzing human behavior. Early GER metho…