1 paper
Xu Shaowu, Jia Xibin, Gao Junyu +3
Long-term action recognition (LTAR) is challenging due to extended temporal spans with complex atomic action correlations and visual confounders. Although vision-language models (V…