2 papers
cs.CV2026
Efficient Online 3D Multi-Camera Multi-Object Tracking and Pose Estimation
Linh Van Ma, Tran Thien Dat Nguyen, Juhua Hu +2
This paper proposes a fast and online method for jointly performing 3D multi-object tracking and pose estimation using multiple monocular cameras. Our algorithm requires only 2D bo…
cs.CV2025
Hierarchy-Aware Fine-Tuning of Vision-Language Models
Jiayu Li, Rajesh Gangireddy, Samet Akcay +2
Vision-Language Models (VLMs) learn powerful multimodal representations through large-scale image-text pretraining, but adapting them to hierarchical classification is underexplore…