Publications (249)
TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment
Jiarun Liu, Qifeng Chen, Yiru Zhao +3
CoDeF: Content Deformation Fields for Temporally Consistent Video Processing
Hao Ouyang, Qiuyu Wang, Yuxi Xiao +6
DRINet++: Efficient Voxel-as-point Point Cloud Segmentation
Maosheng Ye, Rui Wan, Shuangjie Xu +2
Using Left and Right Brains Together: Towards Vision and Language Planning
Jun Cen, Chenfei Wu, Xiao Liu +6
ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
Zhaoyang Liu, Jingjing Xie, Zichen Ding +27
CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command Recognition
Wenliang Dai, Samuel Cahyawijaya, Tiezheng Yu +10
MagicQuill: An Intelligent Interactive Image Editing System
Zichen Liu, Yue Yu, Hao Ouyang +6
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
Xuanhua He, Quande Liu, Zixuan Ye +7
Learning High-resolution Vector Representation from Multi-Camera Images for 3D Object Detection
Zhili Chen, Shuangjie Xu, Maosheng Ye +4
Large Motion Video Autoencoding with Cross-modal Video VAE
Yazhou Xing, Yang Fei, Yingqing He +4
Hawk: Learning to Understand Open-World Video Anomalies
Jiaqi Tang, Hao Lu, Ruizheng Wu +7
Embedding Novel Views in a Single JPEG Image
Yue Wu, Guotao Meng, Qifeng Chen
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
Mingzhe Zheng, Dingjie Song, Guanyu Zhou +7
LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis
Hanlin Wang, Hao Ouyang, Qiuyu Wang +5
Video Waterdrop Removal via Spatio-Temporal Fusion in Driving Scenes
Qiang Wen, Yue Wu, Qifeng Chen
Master Rules from Chaos: Learning to Reason, Plan, and Interact from Chaos for Tangram Assembly
Chao Zhao, Chunli Jiang, Lifan Luo +4
Photographic Image Synthesis with Cascaded Refinement Networks
Qifeng Chen, Vladlen Koltun
Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation
Yang Fei, George Stoica, Jingyuan Liu +4
Point Cloud Compression with Sibling Context and Surface Priors
Zhili Chen, Zian Qian, Sukai Wang +1
Randomized Quantization: A Generic Augmentation for Data Agnostic Self-supervised Learning
Huimin Wu, Chenyang Lei, Xiao Sun +5
Learning Generalizable Hand-Object Tracking from Synthetic Demonstrations
Yinhuai Wang, Runyi Yu, Hok Wai Tsui +9
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
Zeyue Tian, Binxin Yang, Zhaoyang Liu +8
WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
Hanlin Wang, Hao Ouyang, Qiuyu Wang +10
Edicho: Consistent Image Editing in the Wild
Qingyan Bai, Hao Ouyang, Yinghao Xu +5
Rethinking Layered Graphic Design Generation with a Top-Down Approach
Jingye Chen, Zhaowen Wang, Nanxuan Zhao +4
HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts
Xinyu Liu, Yingqing He, Lanqing Guo +10
AvatarArtist: Open-Domain 4D Avatarization
Hongyu Liu, Xuan Wang, Ziyu Wan +6
High-Fidelity GAN Inversion for Image Attribute Editing
Tengfei Wang, Yong Zhang, Yanbo Fan +2
Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
Guoxuan Chen, Chufeng Xiao, Haoran Yang +30
Boogu-Image-0.1 is an open-source multimodal model family that supports high-quality text-to-image generation, fast inference, instruction-based image editing, and bilingual (Chine…
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
Yihao Meng, Zichen Liu, Hao Ouyang +11
PhysHSI: Towards a Real-World Generalizable and Natural Humanoid-Scene Interaction System
Huayi Wang, Wentao Zhang, Runyi Yu +10
HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos
Yinhuai Wang, Qihan Zhao, Yuen Fui Lau +6
TPCN: Temporal Point Cloud Networks for Motion Forecasting
Maosheng Ye, Tongyi Cao, Qifeng Chen
Show, Don't Tell: Morphing Latent Reasoning into Image Generation
Harold Haodong Chen, Xinxiang Yin, Wen-Jie Shu +6
ControlLLM: Augment Language Models with Tools by Searching on Graphs
Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao +8
SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality
Chenyang Lei, Liyi Chen, Jun Cen +6
Learning to Denoise Astronomical Images with U-nets
Antonia Vojtekova, Maggie Lieu, Ivan Valtchanov +4
Music-oriented Dance Video Synthesis with Pose Perceptual Loss
Xuanchi Ren, Haoran Li, Zijian Huang +1
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
Runtao Liu, Haoyu Wu, Zheng Ziqiang +4
FlyAware: Inertia-Aware Aerial Manipulation via Vision-Based Estimation and Post-Grasp Adaptation
Biyu Ye, Na Fan, Zhengping Fan +4
Deep Reinforced Attention Learning for Quality-Aware Visual Recognition
Duo Li, Qifeng Chen
Real-time 3D-aware Portrait Editing from a Single Image
Qingyan Bai, Zifan Shi, Yinghao Xu +7
Blind Video Deflickering by Neural Filtering with a Flawed Atlas
Chenyang Lei, Xuanchi Ren, Zhaoxiang Zhang +1
Human MotionFormer: Transferring Human Motions with Vision Transformers
Hongyu Liu, Xintong Han, Chengbin Jin +8
Bootstrap Motion Forecasting With Self-Consistent Constraints
Maosheng Ye, Jiamiao Xu, Xunnong Xu +3
Real-time 6K Image Rescaling with Rate-distortion Optimization
Chenyang Qi, Xin Yang, Ka Leong Cheng +2
Semi-parametric Image Synthesis
Xiaojuan Qi, Qifeng Chen, Jiaya Jia +1
Rotating without Seeing: Towards In-hand Dexterity through Touch
Zhao-Heng Yin, Binghao Huang, Yuzhe Qin +2
AvatarPointillist: AutoRegressive 4D Gaussian Avatarization
Hongyu Liu, Xuan Wang, Zijian Wu +7
InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation
Zhefan Rao, Bin Zou, Haoxuan Che +5
LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models
Qiang Wen, Zhefan Rao, Yazhou Xing +1
SkillMimic: Learning Basketball Interaction Skills from Demonstrations
Yinhuai Wang, Qihan Zhao, Runyi Yu +10
Diffusion-Based Visual Art Creation: A Survey and New Perspectives
Bingyuan Wang, Qifeng Chen, Zeyu Wang
Towards Degradation-Robust Reconstruction in Generalizable NeRF
Chan Ho Park, Ka Leong Cheng, Zhicheng Wang +1
Switch: Learning Agile Skills Switching for Humanoid Robots
Yuen-Fui Lau, Qihan Zhao, Yinhuai Wang +4
MetaPortrait: Identity-Preserving Talking Head Generation with Fast Personalized Adaptation
Bowen Zhang, Chenyang Qi, Pan Zhang +6
High-fidelity 3D GAN Inversion by Pseudo-multi-view Optimization
Jiaxin Xie, Hao Ouyang, Jingtan Piao +2
Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
Jianmin Chen, Jiaqi Tang, Wei Wei +9
Robust Reflection Removal with Flash-only Cues in the Wild
Chenyang Lei, Xudong Jiang, Qifeng Chen
GIC: Gaussian-Informed Continuum for Physical Property Identification and Simulation
Junhao Cai, Yuji Yang, Weihao Yuan +5
Learning to Learn Parameterized Classification Networks for Scalable Input Images
Duo Li, Anbang Yao, Qifeng Chen
Attack-Resistant Federated Learning with Residual-based Reweighting
Shuhao Fu, Chulin Xie, Bo Li +1
Single Image Reflection Separation with Perceptual Losses
Xuaner Zhang, Ren Ng, Qifeng Chen
Evaluating adversarial robustness in simulated cerebellum
Liu Yuezhang, Bo Li, Qifeng Chen
VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention
Mingzhe Zheng, Yongqi Xu, Haojian Huang +8
Controllable Video Generation: A Survey
Yue Ma, Kunyu Feng, Zhongyuan Hu +19
TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering
Jingye Chen, Yupan Huang, Tengchao Lv +3
A Categorized Reflection Removal Dataset with Diverse Real-world Scenes
Chenyang Lei, Xuhua Huang, Chenyang Qi +4
Model as a Game: On Numerical and Spatial Consistency for Generative Games
Jingye Chen, Yuzhong Zhao, Yupan Huang +5
Flipbot: Learning Continuous Paper Flipping via Coarse-to-Fine Exteroceptive-Proprioceptive Exploration
Chao Zhao, Chunli Jiang, Junhao Cai +3
Automatic Speech Recognition Datasets in Cantonese: A Survey and New Dataset
Tiezheng Yu, Rita Frieske, Peng Xu +9
FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation
Yisheng He, Haibin Huang, Haoqiang Fan +2
Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution Adaptation
Lanqing Guo, Yingqing He, Haoxin Chen +9
LLMs Meet Multimodal Generation and Editing: A Survey
Yingqing He, Zhaoyang Liu, Jingye Chen +13
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
Yifan Wang, Liya Ji, Zhanghan Ke +3
RGE-GS: Reward-Guided Expansive Driving Scene Reconstruction via Diffusion Priors
Sicong Du, Jiarun Liu, Qifeng Chen +3
Polarized Reflection Removal with Perfect Alignment in the Wild
Chenyang Lei, Xuhua Huang, Mengdi Zhang +3
One Model to Edit Them All: Free-Form Text-Driven Image Manipulation with Semantic Modulations
Yiming Zhu, Hongyu Liu, Yibing Song +5
Deep Video Prior for Video Consistency and Propagation
Chenyang Lei, Yazhou Xing, Hao Ouyang +1
Latent Guard: a Safety Framework for Text-to-image Generation
Runtao Liu, Ashkan Khakzar, Jindong Gu +3
Physics Assisted Deep Learning for Indoor Imaging using Phaseless Wi-Fi Measurements
Samruddhi Deshmukh, Amartansh Dubey, Dingfei Ma +2
EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation
Yue Ma, Xu Ye, Qinghe Wang +9
In-Domain GAN Inversion for Faithful Reconstruction and Editability
Jiapeng Zhu, Yujun Shen, Yinghao Xu +3
MedHorizon: Towards Long-context Medical Video Understanding in the Wild
Bodong Du, Bowen Liu, Yang Yu +8
Optimizing Image Compression via Joint Learning with Denoising
Ka Leong Cheng, Yueqi Xie, Qifeng Chen
AudioX: A Unified Framework for Anything-to-Audio Generation
Zeyue Tian, Zhaoyang Liu, Yizhu Jin +6
Threat-Aware UAV Dodging of Human-Thrown Projectiles with an RGB-D Camera
Yuying Zhang, Na Fan, Haowen Zheng +4
Video Depth Estimation by Fusing Flow-to-Depth Proposals
Jiaxin Xie, Chenyang Lei, Zhuwen Li +2
Safety-aware Motion Prediction with Unseen Vehicles for Autonomous Driving
Xuanchi Ren, Tao Yang, Li Erran Li +2
LinkGAN: Linking GAN Latents to Pixels for Controllable Image Synthesis
Jiapeng Zhu, Ceyuan Yang, Yujun Shen +4
Joint Depth and Normal Estimation from Real-world Time-of-flight Raw Data
Rongrong Gao, Na Fan, Changlin Li +2
Rodin: A Generative Model for Sculpting 3D Digital Avatars Using Diffusion
Tengfei Wang, Bo Zhang, Ting Zhang +8
4D Panoptic Scene Graph Generation
Jingkang Yang, Jun Cen, Wenxuan Peng +6
Robust Depth Enhancement via Polarization Prompt Fusion Tuning
Kei Ikemura, Yiming Huang, Felix Heide +3
1-HKUST: Object Detection in ILSVRC 2014
Cewu Lu, Hao Chen, Qifeng Chen +3
HR Human: Modeling Human Avatars with Triangular Mesh and High-Resolution Textures from Videos
Qifeng Chen, Rengan Xie, Kai Huang +4
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
Kien T. Pham, Yingqing He, Yazhou Xing +2
Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control
Zeqian Long, Mingzhe Zheng, Kunyu Feng +6
Image Inpainting with External-internal Learning and Monochromic Bottleneck
Tengfei Wang, Hao Ouyang, Qifeng Chen
Online Overexposed Pixels Hallucination in Videos with Adaptive Reference Frame Selection
Yazhou Xing, Amrita Mazumdar, Anjul Patney +5