1 paper
Zhouzhi Xiong, Chuxi Zhang, Weizhen He +3
Frozen vision-language models (VLMs) remain unreliable on fine-grained left-right claims, and raw claim likelihoods need not reliably rank verification errors. After a horizontal-r…