1 paper
Sa Zhu, Wanqian Zhang, Lin Wang +4
Open-Vocabulary Temporal Action Detection (OV-TAD) aims to classify and localize action segments in untrimmed videos for unseen categories. Previous methods rely solely on global a…