1 paper
Xin Huang, Ruibin Li, Tong Jia +2
Vision-Language Models (VLMs) are essential for multimodal tasks, especially compositional reasoning (CR) tasks, which require distinguishing fine-grained semantic differences betw…