14 papers · 1 filter
Identity-Aware Human-Object Interaction Motion Captioning
Yiming Wang, Yonghao Dang, Huilai Li +2
Existing human-object interaction (HOI) motion captioning methods typically describe what happens while referring to the subject using generic terms such as "a person" or "someone"…
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
Huilai Li, Xiaomeng Di, Ying Xing +3
Weakly supervised Audio-Visual Video Parsing (AVVP) aims to recognize and temporally localize audio, visual, and audio-visual events in videos using only coarse-grained labels. Fac…
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers
Yiyang Ma, Feng Zhou, Xuedan Yin +3
Leveraging pre-trained Diffusion Transformers (DiTs) for high-resolution (HR) image synthesis often leads to spatial layout collapse and degraded texture fidelity. Prior work mitig…
3DGAA: Realistic and Robust 3D Gaussian-based Adversarial Attack for Autonomous Driving
Yixun Zhang, Lizhi Wang, Junjun Zhao +4
Camera-based perception in connected and autonomous vehicles remains exposed to physical adversarial attacks. Prior attacks often either optimize image-plane textures, weakening cr…
MaskSem: Semantic-Guided Masking for Learning 3D Hybrid High-Order Motion Representation
Wei Wei, Shaojie Zhang, Yonghao Dang +1
Human action recognition is a crucial task for intelligent robotics, particularly within the context of human-robot collaboration research. In self-supervised skeleton-based action…
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
Meng Chen, Jiawei Tu, Chao Qi +4
The significant advancements in embodied vision navigation have raised concerns about its susceptibility to adversarial attacks exploiting deep neural networks. Investigating the a…