Showing cs.CVShow all
3 papers · 1 filter
cs.CV2025
Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models
Yuxuan Liang, Xu Li, Xiaolei Chen +5
As the demand for high-resolution image processing in Large Vision-Language Models (LVLMs) grows, sub-image partitioning has become a popular approach for mitigating visual informa…
cs.CV2025
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
Xu Li, Yi Zheng, Haotian Chen +5
Large Vision-Language Models (LVLMs) have achieved remarkable success in a wide range of multimodal tasks by integrating pre-trained vision encoders and large language models. Howe…
cs.CV2024
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
Haibo Wang, Chenghang Lai, Yixuan Sun +1
Video Question Answering (VideoQA) aims to answer natural language questions based on the information observed in videos. Despite the recent success of Large Multimodal Models (LMM…