1 paper
Rongyu Yu, Ke Niu, Fengxiang He
Vision-language models (VLMs) can estimate physical quantities such as duration, speed, and acceleration from visual observations, but existing benchmarks primarily assess overall…