2 papers
cs.CV2025
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
Bin Wang, Wentong Li, Wenqian Wang +3
Recently, large-scale pre-trained vision-language models (e.g., CLIP), have garnered significant attention thanks to their powerful representative capabilities. This inspires resea…
cs.CV2024
EraW-Net: Enhance-Refine-Align W-Net for Scene-Associated Driver Attention Estimation
Jun Zhou, Chunsheng Liu, Faliang Chang +4
Associating driver attention with driving scene across two fields of views (FOVs) is a hard cross-domain perception problem, which requires comprehensive consideration of cross-vie…