NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (63)

cs.CV2023

BiBench: Benchmarking and Analyzing Network Binarization

Haotong Qin, Mingyuan Zhang, Yifu Ding +5

cs.CV2024

MeshAnything: Artist-Created Mesh Generation with Autoregressive Transformers

Yiwen Chen, Tong He, Di Huang +9

cs.CV2021

Variational Relational Point Completion Network

Liang Pan, Xinyi Chen, Zhongang Cai +4

cs.CV2024

SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters

Jianping Jiang, Weiye Xiao, Zhengyu Lin +7

cs.CV2026

Scaling Spatial Intelligence with Multimodal Foundation Models

Zhongang Cai, Ruisi Wang, Chenyang Gu +26

cs.CV2025

Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos

Xianrui Luo, Juewen Peng, Zhongang Cai +4

cs.CV2022

Benchmarking and Analyzing 3D Human Pose and Shape Estimation Beyond Algorithms

Hui En Pang, Zhongang Cai, Lei Yang +2

cs.CV2025

SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation

Wanqi Yin, Zhongang Cai, Ruisi Wang +12

cs.CV2024

AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and Indexing

Fan Yang, Tianyi Chen, Xiaosheng He +4

cs.CV2023

Story-to-Motion: Synthesizing Infinite and Controllable Character Animation from Long Text

Zhongfei Qing, Zhongang Cai, Zhitao Yang +1

cs.RO2019

Siamese Convolutional Neural Network for Sub-millimeter-accurate Camera Pose Estimation and Visual Servoing

Cunjun Yu, Zhongang Cai, Hung Pham +1

cs.CV2021

Unsupervised 3D Shape Completion through GAN Inversion

Junzhe Zhang, Xinyi Chen, Zhongang Cai +6

cs.CV2026

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

Jing Lin, Ruisi Wang, Junzhe Lu +10

cs.CV2025

Holistic Evaluation of Multimodal LLMs on Spatial Intelligence

Zhongang Cai, Yubo Wang, Qingping Sun +21

cs.CV2026

EgoLife: Towards Egocentric Life Assistant

Jingkang Yang, Shuai Liu, Hongming Guo +19

cs.CV2023

HuMMan: Multi-Modal 4D Human Dataset for Versatile Sensing and Modeling

Zhongang Cai, Daxuan Ren, Ailing Zeng +12

cs.CV2026

Demystifying Video Reasoning

Ruisi Wang, Zhongang Cai, Fanyi Pu +11

cs.CV2022

Monocular 3D Object Reconstruction with GAN Inversion

Junzhe Zhang, Daxuan Ren, Zhongang Cai +3

cs.CV2023

ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model

Mingyuan Zhang, Xinying Guo, Liang Pan +5

cs.CV2021

Garment4D: Garment Reconstruction from Point Cloud Sequences

Fangzhou Hong, Liang Pan, Zhongang Cai +1

cs.CV2026

ConsistCompose: Unified Multimodal Layout Control for Image Composition

Xuanke Shi, Boxuan Li, Xiaoyang Han +4

cs.CV2024

WHAC: World-grounded Humans and Cameras

Wanqi Yin, Zhongang Cai, Ruisi Wang +9

cs.CV2021

Unsupervised Domain Adaptive 3D Detection with Multi-Level Consistency

Zhipeng Luo, Zhongang Cai, Changqing Zhou +7

cs.CV2026

From Pixels to Words -- Towards Native One-Vision Models at Scale

Haiwen Diao, Jiahao Wang, Penghao Wu +18

cs.CV2024

Playing for 3D Human Recovery

Zhongang Cai, Mingyuan Zhang, Jiawei Ren +7

cs.CV2022

Delving Deep into the Generalization of Vision Transformers under Distribution Shifts

Chongzhi Zhang, Mingyuan Zhang, Shanghang Zhang +6

cs.CV2026

A Very Big Video Reasoning Suite

Maijunxian Wang, Ruisi Wang, Juyi Lin +53

cs.CV2024

SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation

Zhongang Cai, Wanqi Yin, Ailing Zeng +10

cs.CV2021

BiPointNet: Binary Neural Network for Point Clouds

Haotong Qin, Zhongang Cai, Mingyuan Zhang +5

cs.CV2025

DPoser-X: Diffusion Model as Robust 3D Whole-body Human Pose Prior

Junzhe Lu, Jing Lin, Hongkun Dou +8

cs.CV2022

Versatile Multi-Modal Pre-Training for Human-Centric Perception

Fangzhou Hong, Liang Pan, Zhongang Cai +1

cs.CV2022

PTTR: Relational 3D Point Cloud Object Tracking with Transformer

Changqing Zhou, Zhipeng Luo, Yueru Luo +5

cs.CV2023

DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-centric Rendering

Wei Cheng, Ruixiang Chen, Wanqi Yin +18

cs.CV2022

MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model

Mingyuan Zhang, Zhongang Cai, Liang Pan +4

cs.CV2024

Disco4D: Disentangled 4D Human Generation and Animation from a Single Image

Hui En Pang, Shuai Liu, Zhongang Cai +3

cs.CV2023

Zolly: Zoom Focal Length Correctly for Perspective-Distorted Human Mesh Reconstruction

Wenjia Wang, Yongtao Ge, Haiyi Mei +6

cs.CV2026

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

Wenhao Shen, Hao Wang, Wanqi Yin +5

cs.CV2023

PointHPS: Cascaded 3D Human Pose and Shape Estimation from Point Clouds

Zhongang Cai, Liang Pan, Chen Wei +6

cs.LG2020

Balanced Activation for Long-tailed Visual Recognition

Jiawei Ren, Cunjun Yu, Zhongang Cai +1

cs.CV2023

GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting

Yiwen Chen, Zilong Chen, Chi Zhang +7

cs.CV2020

Leveraging Temporal Information for 3D Detection and Domain Adaptation

Cunjun Yu, Zhongang Cai, Daxuan Ren +1

cs.CV2025

Controllable Human-centric Keyframe Interpolation with Generative Prior

Zujin Guo, Size Wu, Zhongang Cai +2

cs.CV2024

Large Motion Model for Unified Multi-Modal Motion Generation

Mingyuan Zhang, Daisheng Jin, Chenyang Gu +8

cs.CV2023

FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing

Mingyuan Zhang, Huirong Li, Zhongang Cai +3

cs.CV2022

Robust Partial-to-Partial Point Cloud Registration in a Full Range

Liang Pan, Zhongang Cai, Ziwei Liu

cs.CV2026

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

Haiwen Diao, Penghao Wu, Hanming Deng +55

cs.CV2025

ADHMR: Aligning Diffusion-based Human Mesh Recovery via Direct Preference Optimization

Wenhao Shen, Wanqi Yin, Xiaofeng Yang +6

cs.CV2023

Towards Robust and Expressive Whole-body Human Pose and Shape Estimation

Hui EnPang, Zhongang Cai, Lei Yang +4

cs.RO2018

3D Convolution on RGB-D Point Clouds for Accurate Model-free Object Pose Estimation

Zhongang Cai, Cunjun Yu, Quang-Cuong Pham

cs.CV2026

Vision as Unified Multimodal Generation

Xiaoyang Han, Jianhua Li, Kewang Deng +14

cs.CV2020

Leveraging Localization for Multi-camera Association

Zhongang Cai, Cunjun Yu, Junzhe Zhang +2

cs.CV2023

SynBody: Synthetic Dataset with Layered Human Models for 3D Human Perception and Modeling

Zhitao Yang, Zhongang Cai, Haiyi Mei +12

cs.CV2026

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

Chenyang Gu, Mingyuan Zhang, Haozhe Xie +3

cs.CV2024

AiOS: All-in-One-Stage Expressive Human Pose and Shape Estimation

Qingping Sun, Yanjun Wang, Ailing Zeng +8

cs.CV2020

MessyTable: Instance Association in Multiple Camera Views

Zhongang Cai, Junzhe Zhang, Daxuan Ren +5

cs.CV2022

AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars

Fangzhou Hong, Mingyuan Zhang, Liang Pan +3

cs.CV2026

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Runmao Yao, Kairui Hu, Yukang Cao +11

cs.CV2023

Variational Relational Point Completion Network for Robust 3D Classification

Liang Pan, Xinyi Chen, Zhongang Cai +4

cs.CV2023

IT3D: Improved Text-to-3D Generation with Explicit View Synthesis

Yiwen Chen, Chi Zhang, Xiaofeng Yang +4

cs.CV2023

Learning Dense UV Completion for Human Mesh Recovery

Yanjun Wang, Qingping Sun, Wenjia Wang +4

cs.CV2021

CSG-Stump: A Learning Friendly CSG-Like Representation for Interpretable Shape Parsing

Daxuan Ren, Jianmin Zheng, Jianfei Cai +8

cs.CV2023

Digital Life Project: Autonomous 3D Characters with Social Intelligence

Zhongang Cai, Jianping Jiang, Zhongfei Qing +20

cs.CV2021

Multi-View Partial (MVP) Point Cloud Challenge 2021 on Completion and Registration: Methods and Results

Liang Pan, Tong Wu, Zhongang Cai +26