collaborators

13 papers

cs.AI2026

Uncovering Latent Depression Severity for Binary Depression Detection via Advantage-weighting Ranking

Manning Gao, Tingyi Liu, Leheng Zhang +3

Automatic depression detection using audio-visual data faces significant challenges, particularly in disentangling overlapping feature distributions and establishing robust decisio…

cs.AI2026

A Conflict-Aware Penalty and Statistical Loss Framework for Balancing Modalities and Enhancing Stability in Multimodal Sentiment Analysis

Jianheng Dai, Jiazhang Liang, Sijie Mai

Multimodal Sentiment Analysis (MSA) fuses text, acoustic, and visual streams to infer sentiment. Because pre-trained text encoders are far more expressive than their acoustic and v…

cs.LG2026

QASA: Quality-Aware Semantic Augmentation for Robust Multimodal Sentiment Analysis

Jiazhang Liang, Jianheng Dai, Miaosen Luo +2

Multimodal large language models have demonstrated strong ability in capturing semantic representations for multimodal sentiment analysis. Their capacity to learn stable and genera…

cs.LG2026

Disentangling Bias by Modeling Intra- and Inter-modal Causal Attention for Multimodal Sentiment Analysis

Menghua Jiang, Yuxia Lin, Baoliang Chen +3

Multimodal sentiment analysis (MSA) aims to understand human emotions by integrating information from multiple modalities, such as text, audio, and visual data. However, existing m…

cs.LG2026

Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective

Sijie Mai, Shiqin Han

Multimodal affective computing aims to predict humans' sentiment, emotion, intention, and opinion using language, acoustic, and visual modalities. However, current models often lea…

cs.CL2026

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

Miaosen Luo, Zhenhao Yang, Jieshen Long +3

Multimodal sentiment analysis aims to integrate textual, acoustic, and visual information for deep emotional understanding. Despite the progress of multimodal large language models…