Showing 2025Show all
2 papers · 1 filter
cs.CV2025
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
Amirul Rahman, Qiang Xu, Xueying Huang
Despite significant advancements, Large Vision-Language Models (LVLMs) continue to face challenges in complex visual reasoning tasks that demand deep contextual understanding, mult…
cs.CV2025
Elevating Visual Question Answering through Implicitly Learned Reasoning Pathways in LVLMs
Liu Jing, Amirul Rahman
Large Vision-Language Models (LVLMs) have shown remarkable progress in various multimodal tasks, yet they often struggle with complex visual reasoning that requires multi-step infe…