1 paper
Shuo Cao, Yihao Liu, Xiaohui Li +3
Transformer-based models like ViViT and TimeSformer have advanced video understanding by effectively modeling spatiotemporal dependencies. Recent video generation models, such as S…