1 paper · 1 filter
Ce Zhang, Kaixin Ma, Tianqing Fang +5
Recent Large Vision-Language Models (LVLMs) have advanced multi-modal understanding by incorporating finer-grained visual perception and encoding. However, such methods incur signi…