2 papers
cs.CV2026
SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction
Quanjiang Guo, Chong Mu, Jiazhou Pan +4
Multimodal Information Extraction (MIE)-covering tasks such as Multimodal Named Entity Recognition (MNER), Relation Extraction (MRE), and Event Extraction (MEE)-is essential for un…
cs.CV2025
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
Ben Zhang, LuLu Yu, Lei Gao +3
During reasoning in vision-language models (VLMs), false positive (FP) reasoning occurs when a model produces the correct answer but follows an incorrect reasoning path, resulting…