1 paper
Enqi Liu, Liyuan Pan, Yan Yang +4
Fine-grained video action recognition can be conceptualized as a video-text matching problem. Previous approaches often rely on global video semantics to consolidate video embeddin…