Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning
Tiecheng Cai, Zexian Yang, Chao Chen +2
Sentimental Image Captioning (SIC) requires balancing emotional expression with visual fidelity. Existing methods often struggle with this trade-off, leading to hallucinations due…
cs.CV2025
Uneven Event Modeling for Partially Relevant Video Retrieval
Sa Zhu, Huashan Chen, Wanqian Zhang +4
Given a text query, partially relevant video retrieval (PRVR) aims to retrieve untrimmed videos containing relevant moments, wherein event modeling is crucial for partitioning the…
cs.CV2025
Critique Before Thinking: Mitigating Hallucination through Rationale-Augmented Instruction Tuning
Zexian Yang, Dian Li, Dayan Wu +2
Despite significant advancements in multimodal reasoning tasks, existing Large Vision-Language Models (LVLMs) are prone to producing visually ungrounded responses when interpreting…