6 papers
Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation
Xinhao Hu, Yiyi Zhang, Liqing Zhang +1
Pedestrian motion, due to its causal nature, is strongly influenced by domain gaps arising from discrepancies between training and testing data distributions. Focusing on 3D human…
Any3DAvatar: Fast and High-Quality Full-Head 3D Avatar Reconstruction from Single Portrait Image
Yujie Gao, Yao Xiao, Xiangnan Zhu +4
Reconstructing a complete 3D head from a single portrait remains challenging because existing methods still face a sharp quality-speed trade-off: high-fidelity pipelines often rely…
Bottleneck Tokens for Unified Multimodal Retrieval
Siyu Sun, Jing Ren, Zhaohe Liao +8
Adapting decoder-only multimodal large language models (MLLMs) for unified multimodal retrieval faces two structural gaps. First, existing methods rely on implicit pooling, which o…
High-Quality 3D Head Reconstruction from Any Single Portrait Image
Jianfu Zhang, Yujie Gao, Jiahui Zhan +4
In this work, we introduce a novel high-fidelity 3D head reconstruction method from a single portrait image, regardless of perspective, expression, or accessories. Despite signific…
User-Friendly Customized Generation with Multi-Modal Prompts
Linhao Zhong, Yan Hong, Wentao Chen +4
Text-to-image generation models have seen considerable advancement, catering to the increasing interest in personalized image creation. Current customization techniques often neces…
Assessing Image Inpainting via Re-Inpainting Self-Consistency Evaluation
Tianyi Chen, Jianfu Zhang, Yan Hong +2
Image inpainting, the task of reconstructing missing segments in corrupted images using available data, faces challenges in ensuring consistency and fidelity, especially under info…