3 papers
cs.CV2026
Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension
Lian Xu, Mohammed Bennamoun, Farid Boussaid +3
Referring expression comprehension (REC) aims to localize the object in an image described by natural language. In Weakly supervised REC (WREC), existing approaches primarily opera…
cs.CV2026
UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation
Jiaying Lin, Dan Xu
Functionality segmentation in 3D scenes requires an agent to ground implicit natural-language instructions into precise masks of fine-grained interactive elements. Existing methods…
cs.CV2025
TSkel-Mamba: Temporal Dynamic Modeling via State Space Model for Human Skeleton-based Action Recognition
Yanan Liu, Jun Liu, Hao Zhang +4
Skeleton-based action recognition has garnered significant attention in the computer vision community. Inspired by the recent success of the selective state-space model (SSM) Mamba…