1 paper · 1 filter
Linhao Zhang, Aiwei Liu, Yuan Liu +1
Vision-language models (VLMs) have made strong progress on high-level image-text alignment, yet their ability to perceive subtle visual differences remains limited. We study this p…