collaborators

5 papers

cs.CV2026

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search

Chaodong Jia, Zequn Xie, Xibei Jia +3

Text-Based Person Search (TBPS) aims to retrieve pedestrian images using natural language queries. However, existing TBPS models, especially those based on CLIP, struggle with fine…

cs.CV2026

Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search

Zequn Xie, Guijin Luo, Chuxin Wang +4

Text-based person anomaly search retrieves specific behavioral events from surveillance archives using natural-language queries. Although recent pose-aware methods align geometric…

cs.CV2026

HVD: Human Vision-Driven Video Representation Learning for Text-Video Retrieval

Zequn Xie, Xin Liu, Boyun Zhang +3

The success of CLIP has driven substantial progress in text-video retrieval. However, current methods often suffer from "blind" feature interaction, where the model struggles to di…

cs.CV2026

Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval

Zequn Xie, Boyun Zhang, Yuxiao Lin +1

Video-text retrieval (VTR) aims to locate relevant videos using natural language queries. Current methods, often based on pre-trained models like CLIP, are hindered by video's inhe…

cs.CL2025

Chat-Driven Text Generation and Interaction for Person Retrieval

Zequn Xie, Chuxin Wang, Sihang Cai +3

Text-based person search (TBPS) enables the retrieval of person images from large-scale databases using natural language descriptions, offering critical value in surveillance appli…