4 papers
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
Jiawei Ge, Xintian Zhang, Jiuxin Cao +9
Cross-view Referring Multi-Object Tracking (CRMOT) aims to track multiple objects specified by natural language across multiple camera views, with globally consistent identities. D…
Debate-Enhanced Pseudo Labeling and Frequency-Aware Progressive Debiasing for Weakly-Supervised Camouflaged Object Detection with Scribble Annotations
Jiawei Ge, Jiuxin Cao, Xinyi Li +5
Weakly-Supervised Camouflaged Object Detection (WSCOD) aims to locate and segment objects that are visually concealed within their surrounding scenes, relying solely on sparse supe…
P-TAME: Explain Any Image Classifier with Trained Perturbations
Mariano V. Ntrougkas, Vasileios Mezaris, Ioannis Patras
The adoption of Deep Neural Networks (DNNs) in critical fields where predictions need to be accompanied by justifications is hindered by their inherent black-box nature. In this pa…
VidCtx: Context-aware Video Question Answering with Image Models
Andreas Goulas, Vasileios Mezaris, Ioannis Patras
To address computational and memory limitations of Large Multimodal Models in the Video Question-Answering task, several recent methods extract textual representations per frame (e…