6 papers
Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification
Xiao Wang, Bing Wang, Bin Yang +3
This paper surveys the shift in person re-identification from single‑modal RGB approaches to cross‑modal and multi‑modal methods, covering tasks such as visible‑infrared, text‑imag…
Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance
Wenjie Qian, Bin Yang, Xiao Wang +4
Text-to-image person re-identification (TIPR) retrieves target persons using natural language descriptions. However, existing methods largely overlook resolution variance in real-w…
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
Xiao Wang, Minglei Yang, Bin Yang +4
Identifying key individuals in video scenes is essential for applications such as automated video editing and intelligent surveillance. Current methods primarily focus on static im…
FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Prompts
Xin Xu, Weilong Li, Wei Liu +5
Federated Domain Generalization for Person Re-Identification (FedDG-ReID) learns domain-invariant representations from decentralized data. While Vision Transformer (ViT) is widely…
An Empirical Study of Federated Prompt Learning for Vision Language Model
Zhihao Wang, Wenke Huang, Tian Chen +7
The Vision Language Model (VLM) excels in aligning vision and language representations, and prompt learning has emerged as a key technique for adapting such models to downstream ta…
Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model
Wenke Huang, Jian Liang, Xianda Guo +14
Multi-modal Large Language Models (MLLMs) integrate visual and linguistic reasoning to address complex tasks such as image captioning and visual question answering. While MLLMs dem…