From the 1 of 4 linked papers with an AI index.
4 papers
CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
Xiangqun Zhang, Likai Wang, Zekun Qian +2
The paper introduces CD-RMOT-Bench, a benchmark for evaluating how well referring multi-object tracking models trained on one visual domain perform on different, unseen domains, an…
COVTrack++: Learning Open-Vocabulary Multi-Object Tracking from Continuous Videos via a Synergistic Paradigm
Zekun Qian, Wei Feng, Ruize Han +1
Multi-Object Tracking (MOT) has traditionally focused on a few specific categories, restricting its applicability to real-world scenarios involving diverse objects. Open-Vocabulary…
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
Zekun Qian, Ruize Han, Wei Feng
Object-level spatial-temporal understanding is essential for video question answering, yet existing multimodal large language models (MLLMs) encode frames holistically and lack exp…
VOVTrack: Exploring the Potentiality in Videos for Open-Vocabulary Object Tracking
Zekun Qian, Ruize Han, Junhui Hou +2
Open-vocabulary multi-object tracking (OVMOT) represents a critical new challenge involving the detection and tracking of diverse object categories in videos, encompassing both see…