1 paper · 1 filter
Yucheng Shi, Quanzheng Li, Jin Sun +2
Large Multimodal Models (LMMs), or Vision-Language Models (VLMs), have shown impressive capabilities in a wide range of visual tasks. However, they often struggle with fine-grained…