2 papers
cs.CV2026
Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification
Jiachen Li, Xiaojin Gong, Dongping Zhang
Domain Generalized person Re-identification (DG Re-ID) is a challenging task, where models are trained on source domains but tested on unseen target domains. Although previous pure…
cs.CV2024
Multi-scale Bottleneck Transformer for Weakly Supervised Multimodal Violence Detection
Shengyang Sun, Xiaojin Gong
Weakly supervised multimodal violence detection aims to learn a violence detection model by leveraging multiple modalities such as RGB, optical flow, and audio, while only video-le…