Publications (63)
BiBench: Benchmarking and Analyzing Network Binarization
Haotong Qin, Mingyuan Zhang, Yifu Ding +5
MeshAnything: Artist-Created Mesh Generation with Autoregressive Transformers
Yiwen Chen, Tong He, Di Huang +9
Variational Relational Point Completion Network
Liang Pan, Xinyi Chen, Zhongang Cai +4
SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters
Jianping Jiang, Weiye Xiao, Zhengyu Lin +7
Scaling Spatial Intelligence with Multimodal Foundation Models
Zhongang Cai, Ruisi Wang, Chenyang Gu +26
Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos
Xianrui Luo, Juewen Peng, Zhongang Cai +4
Benchmarking and Analyzing 3D Human Pose and Shape Estimation Beyond Algorithms
Hui En Pang, Zhongang Cai, Lei Yang +2
SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation
Wanqi Yin, Zhongang Cai, Ruisi Wang +12
AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and Indexing
Fan Yang, Tianyi Chen, Xiaosheng He +4
Story-to-Motion: Synthesizing Infinite and Controllable Character Animation from Long Text
Zhongfei Qing, Zhongang Cai, Zhitao Yang +1
Siamese Convolutional Neural Network for Sub-millimeter-accurate Camera Pose Estimation and Visual Servoing
Cunjun Yu, Zhongang Cai, Hung Pham +1
Unsupervised 3D Shape Completion through GAN Inversion
Junzhe Zhang, Xinyi Chen, Zhongang Cai +6
The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
Jing Lin, Ruisi Wang, Junzhe Lu +10
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
Zhongang Cai, Yubo Wang, Qingping Sun +21
EgoLife: Towards Egocentric Life Assistant
Jingkang Yang, Shuai Liu, Hongming Guo +19
HuMMan: Multi-Modal 4D Human Dataset for Versatile Sensing and Modeling
Zhongang Cai, Daxuan Ren, Ailing Zeng +12
Demystifying Video Reasoning
Ruisi Wang, Zhongang Cai, Fanyi Pu +11
Monocular 3D Object Reconstruction with GAN Inversion
Junzhe Zhang, Daxuan Ren, Zhongang Cai +3
ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model
Mingyuan Zhang, Xinying Guo, Liang Pan +5
Garment4D: Garment Reconstruction from Point Cloud Sequences
Fangzhou Hong, Liang Pan, Zhongang Cai +1
ConsistCompose: Unified Multimodal Layout Control for Image Composition
Xuanke Shi, Boxuan Li, Xiaoyang Han +4
WHAC: World-grounded Humans and Cameras
Wanqi Yin, Zhongang Cai, Ruisi Wang +9
Unsupervised Domain Adaptive 3D Detection with Multi-Level Consistency
Zhipeng Luo, Zhongang Cai, Changqing Zhou +7
From Pixels to Words -- Towards Native One-Vision Models at Scale
Haiwen Diao, Jiahao Wang, Penghao Wu +18
Playing for 3D Human Recovery
Zhongang Cai, Mingyuan Zhang, Jiawei Ren +7
Delving Deep into the Generalization of Vision Transformers under Distribution Shifts
Chongzhi Zhang, Mingyuan Zhang, Shanghang Zhang +6
A Very Big Video Reasoning Suite
Maijunxian Wang, Ruisi Wang, Juyi Lin +53
SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation
Zhongang Cai, Wanqi Yin, Ailing Zeng +10
BiPointNet: Binary Neural Network for Point Clouds
Haotong Qin, Zhongang Cai, Mingyuan Zhang +5
DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior
Junzhe Lu, Jing Lin, Hongkun Dou +8
Versatile Multi-Modal Pre-Training for Human-Centric Perception
Fangzhou Hong, Liang Pan, Zhongang Cai +1
PTTR: Relational 3D Point Cloud Object Tracking with Transformer
Changqing Zhou, Zhipeng Luo, Yueru Luo +5
DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-centric Rendering
Wei Cheng, Ruixiang Chen, Wanqi Yin +18
MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model
Mingyuan Zhang, Zhongang Cai, Liang Pan +4
Disco4D: Disentangled 4D Human Generation and Animation from a Single Image
Hui En Pang, Shuai Liu, Zhongang Cai +3
Zolly: Zoom Focal Length Correctly for Perspective-Distorted Human Mesh Reconstruction
Wenjia Wang, Yongtao Ge, Haiyi Mei +6
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery
Wenhao Shen, Hao Wang, Wanqi Yin +5
PointHPS: Cascaded 3D Human Pose and Shape Estimation from Point Clouds
Zhongang Cai, Liang Pan, Chen Wei +6
Balanced Activation for Long-tailed Visual Recognition
Jiawei Ren, Cunjun Yu, Zhongang Cai +1
GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting
Yiwen Chen, Zilong Chen, Chi Zhang +7
Leveraging Temporal Information for 3D Detection and Domain Adaptation
Cunjun Yu, Zhongang Cai, Daxuan Ren +1
Controllable Human-centric Keyframe Interpolation with Generative Prior
Zujin Guo, Size Wu, Zhongang Cai +2
Large Motion Model for Unified Multi-Modal Motion Generation
Mingyuan Zhang, Daisheng Jin, Chenyang Gu +8
FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing
Mingyuan Zhang, Huirong Li, Zhongang Cai +3
Robust Partial-to-Partial Point Cloud Registration in a Full Range
Liang Pan, Zhongang Cai, Ziwei Liu
SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
Haiwen Diao, Penghao Wu, Hanming Deng +55
ADHMR: Aligning Diffusion-based Human Mesh Recovery via Direct Preference Optimization
Wenhao Shen, Wanqi Yin, Xiaofeng Yang +6
Towards Robust and Expressive Whole-body Human Pose and Shape Estimation
Hui EnPang, Zhongang Cai, Lei Yang +4
3D Convolution on RGB-D Point Clouds for Accurate Model-free Object Pose Estimation
Zhongang Cai, Cunjun Yu, Quang-Cuong Pham
Vision as Unified Multimodal Generation
Xiaoyang Han, Jianhua Li, Kewang Deng +14
Leveraging Localization for Multi-camera Association
Zhongang Cai, Cunjun Yu, Junzhe Zhang +2
SynBody: Synthetic Dataset with Layered Human Models for 3D Human Perception and Modeling
Zhitao Yang, Zhongang Cai, Haiyi Mei +12
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
Chenyang Gu, Mingyuan Zhang, Haozhe Xie +3
AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation
Qingping Sun, Yanjun Wang, Ailing Zeng +8
MessyTable: Instance Association in Multiple Camera Views
Zhongang Cai, Junzhe Zhang, Daxuan Ren +5
AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars
Fangzhou Hong, Mingyuan Zhang, Liang Pan +3
Apple-$Ï$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
Runmao Yao, Kairui Hu, Yukang Cao +11
Variational Relational Point Completion Network for Robust 3D Classification
Liang Pan, Xinyi Chen, Zhongang Cai +4
IT3D: Improved Text-to-3D Generation with Explicit View Synthesis
Yiwen Chen, Chi Zhang, Xiaofeng Yang +4
Learning Dense UV Completion for Human Mesh Recovery
Yanjun Wang, Qingping Sun, Wenjia Wang +4
CSG-Stump: A Learning Friendly CSG-Like Representation for Interpretable Shape Parsing
Daxuan Ren, Jianmin Zheng, Jianfei Cai +8
Digital Life Project: Autonomous 3D Characters with Social Intelligence
Zhongang Cai, Jianping Jiang, Zhongfei Qing +20
Multi-View Partial (MVP) Point Cloud Challenge 2021 on Completion and Registration: Methods and Results
Liang Pan, Tong Wu, Zhongang Cai +26