1 paper · 1 filter
David Yifan Yao, Albert J. Zhai, Shenlong Wang
This paper presents a unified approach to understanding dynamic scenes from casual videos. Large pretrained vision foundation models, such as vision-language, video depth predictio…