8 papers
Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors
Zikai Huang, Siyue Chen, Xuemiao Xu +4
Dyadic conversational motion generation is essential for realistic interactive digital humans. Existing approaches typically model conversational behaviors within unified dyadic ge…
Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
Haoxin Yang, Yihong Lin, Jingdan Kang +4
Face anonymization aims to conceal identity information while preserving non-identity attributes. Mainstream diffusion models rely on inference-time interventions such as negative…
ProstaTD: Bridging Surgical Triplet from Classification to Fully Supervised Detection
Yiliang Chen, Zhixi Li, Cheng Xu +6
Surgical triplet detection is a critical task in surgical video analysis. However, existing datasets like CholecT50 lack precise spatial bounding box annotations, rendering triplet…
StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
Haoxin Yang, Bangzhen Liu, Xuemiao Xu +5
The advancement of diffusion models has enhanced the realism of AI-generated content but also raised concerns about misuse, necessitating robust copyright protection and tampering…
Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation
Zikai Huang, Yihan Zhou, Xuemiao Xu +4
Singing-driven 3D head animation is a challenging yet promising task with applications in virtual avatars, entertainment, and education. Unlike speech, singing involves richer emot…
StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion
Haoxin Yang, Weihong Chen, Xuemiao Xu +5
Monocular 3D human pose estimation remains a challenging task due to inherent depth ambiguities and occlusions. Compared to traditional methods based on Transformers or Convolution…