1 paper · 1 filter
Jingyu Sun, Jiachen Tu, Yuyang Xue +8
Vision-language models (VLMs) often answer visual questions using learned language and category priors rather than grounding their predictions in the image itself. Counterfactual i…