1 paper · 1 filter
Xin Huang, Ruibin Li, Tong Jia +2
Vision-Language Models (VLMs) are essential for multimodal tasks, especially compositional reasoning (CR) tasks, which require distinguishing fine-grained semantic differences betw…