1 paper
Jiazheng Xing, Chao Xu, Mengmeng Wang +5
Applying large-scale vision-language pre-trained models like CLIP to few-shot action recognition (FSAR) can significantly enhance both performance and efficiency. While several stu…