1 paper
Fanhong Li, Shurui Zheng, Zi Yin +3
Video foundation models now reach human-level accuracy on physical-reasoning benchmarks, yet such tasks require predicting unobserved physical outcomes. Do these models perform hum…