4 papers
Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis
Shanshan Lin, Yuesheng Wu, Chao Chen +4
Multimodal sentiment analysis (MSA) aims to predict sentiment polarity and intensity from heterogeneous inputs such as text, audio, and vision. While large language models (LLMs) o…
Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning
Tiecheng Cai, Zexian Yang, Chao Chen +2
Sentimental Image Captioning (SIC) requires balancing emotional expression with visual fidelity. Existing methods often struggle with this trade-off, leading to hallucinations due…
Uneven Event Modeling for Partially Relevant Video Retrieval
Sa Zhu, Huashan Chen, Wanqian Zhang +4
Given a text query, partially relevant video retrieval (PRVR) aims to retrieve untrimmed videos containing relevant moments, wherein event modeling is crucial for partitioning the…
Critique Before Thinking: Mitigating Hallucination through Rationale-Augmented Instruction Tuning
Zexian Yang, Dian Li, Dayan Wu +2
Despite significant advancements in multimodal reasoning tasks, existing Large Vision-Language Models (LVLMs) are prone to producing visually ungrounded responses when interpreting…