1 paper
Wenxiao Fan, Jingling Fu, Fang Li +9
Vision-language models (VLMs) are expected to revise their reasoning when visual evidence changes. Failures to do so are often attributed to insufficient visual attention or contex…