1 paper · 1 filter
Clara Petrova, Zhuo Chen, Marin SoljaÄiÄ
Vision-language models (VLMs) perform strongly on multimodal benchmarks, but their ability to follow complex visual paths remains under-tested. We introduce TraversalBench, a contr…