3 papers
cs.MM2026
MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
Xiang Yuan, Xu Chu, Xinrong Chen +6
Multimodal Object-Entity Relation Extraction (MORE) is a challenging task in information extraction research. It aims to identify relations between visual objects and textual entit…
cs.MM2025
Stepwise Schema-Guided Prompting Framework with Parameter Efficient Instruction Tuning for Multimedia Event Extraction
Xiang Yuan, Xinrong Chen, Haochen Li +4
Multimedia Event Extraction (MEE) has become an important task in information extraction research as news today increasingly prefers to contain multimedia content. Current MEE work…
cs.CV2025
Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions
Zhijie Tan, Yuzhi Li, Shengwei Meng +5
Current popular Large Vision-Language Models (LVLMs) are suffering from Hallucinations on Object Attributes (HoOA), leading to incorrect determination of fine-grained attributes in…