NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (249)

cs.CV2026

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

Jiarun Liu, Qifeng Chen, Yiru Zhao +3

cs.CV2024

CoDeF: Content Deformation Fields for Temporally Consistent Video Processing

Hao Ouyang, Qiuyu Wang, Yuxi Xiao +6

cs.CV2021

DRINet++: Efficient Voxel-as-point Point Cloud Segmentation

Maosheng Ye, Rui Wan, Shuangjie Xu +2

cs.CV2024

Using Left and Right Brains Together: Towards Vision and Language Planning

Jun Cen, Chenfei Wu, Xiao Liu +6

cs.CV2025

ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data

Zhaoyang Liu, Jingjing Xie, Zichen Ding +27

cs.CL2022

CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command Recognition

Wenliang Dai, Samuel Cahyawijaya, Tiezheng Yu +10

cs.CV2025

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang +6

cs.CV2025

FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers

Xuanhua He, Quande Liu, Zixuan Ye +7

cs.CV2024

Learning High-resolution Vector Representation from Multi-Camera Images for 3D Object Detection

Zhili Chen, Shuangjie Xu, Maosheng Ye +4

cs.CV2024

Large Motion Video Autoencoding with Cross-modal Video VAE

Yazhou Xing, Yang Fei, Yingqing He +4

cs.CV2024

Hawk: Learning to Understand Open-World Video Anomalies

Jiaqi Tang, Hao Lu, Ruizheng Wu +7

cs.CV2021

Embedding Novel Views in a Single JPEG Image

Yue Wu, Guotao Meng, Qifeng Chen

cs.CV2025

CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation

Mingzhe Zheng, Dingjie Song, Guanyu Zhou +7

cs.CV2025

LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis

Hanlin Wang, Hao Ouyang, Qiuyu Wang +5

cs.CV2023

Video Waterdrop Removal via Spatio-Temporal Fusion in Driving Scenes

Qiang Wen, Yue Wu, Qifeng Chen

cs.RO2025

Master Rules from Chaos: Learning to Reason, Plan, and Interact from Chaos for Tangram Assembly

Chao Zhao, Chunli Jiang, Lifan Luo +4

cs.CV2017

Photographic Image Synthesis with Cascaded Refinement Networks

Qifeng Chen, Vladlen Koltun

cs.CV2025

Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation

Yang Fei, George Stoica, Jingyuan Liu +4

cs.CV2022

Point Cloud Compression with Sibling Context and Surface Priors

Zhili Chen, Zian Qian, Sukai Wang +1

cs.CV2023

Randomized Quantization: A Generic Augmentation for Data Agnostic Self-supervised Learning

Huimin Wu, Chenyang Lei, Xiao Sun +5

cs.RO2025

Learning Generalizable Hand-Object Tracking from Synthetic Demonstrations

Yinhuai Wang, Runyi Yu, Hok Wai Tsui +9

cs.SD2026

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Zeyue Tian, Binxin Yang, Zhaoyang Liu +8

cs.CV2026

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

Hanlin Wang, Hao Ouyang, Qiuyu Wang +10

cs.CV2025

Edicho: Consistent Image Editing in the Wild

Qingyan Bai, Hao Ouyang, Yinghao Xu +5

cs.CV2025

Rethinking Layered Graphic Design Generation with a Top-Down Approach

Jingye Chen, Zhaowen Wang, Nanxuan Zhao +4

cs.CV2024

HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts

Xinyu Liu, Yingqing He, Lanqing Guo +10

cs.CV2025

AvatarArtist: Open-Domain 4D Avatarization

Hongyu Liu, Xuan Wang, Ziyu Wan +6

cs.CV2024

High-Fidelity GAN Inversion for Image Attribute Editing

Tengfei Wang, Yong Zhang, Yanbo Fan +2

cs.CV2026

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Guoxuan Chen, Chufeng Xiao, Haoran Yang +30

Boogu-Image-0.1 is an open-source multimodal model family that supports high-quality text-to-image generation, fast inference, instruction-based image editing, and bilingual (Chine…

#text-to-image generation#multimodal understanding#image editing#bilingual rendering
cs.CV2026

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

Yihao Meng, Zichen Liu, Hao Ouyang +11

cs.RO2025

PhysHSI: Towards a Real-World Generalizable and Natural Humanoid-Scene Interaction System

Huayi Wang, Wentao Zhang, Runyi Yu +10

cs.RO2026

HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos

Yinhuai Wang, Qihan Zhao, Yuen Fui Lau +6

cs.CV2021

TPCN: Temporal Point Cloud Networks for Motion Forecasting

Maosheng Ye, Tongyi Cao, Qifeng Chen

cs.CV2026

Show, Don't Tell: Morphing Latent Reasoning into Image Generation

Harold Haodong Chen, Xinxiang Yin, Wen-Jie Shu +6

cs.CV2023

ControlLLM: Augment Language Models with Tools by Searching on Graphs

Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao +8

cs.CV2024

SimMAT: Exploring Transferability from Vision Foundation Models to Any Image Modality

Chenyang Lei, Liyi Chen, Jun Cen +6

astro-ph.IM2020

Learning to Denoise Astronomical Images with U-nets

Antonia Vojtekova, Maggie Lieu, Ivan Valtchanov +4

cs.CV2019

Music-oriented Dance Video Synthesis with Pose Perceptual Loss

Xuanchi Ren, Haoran Li, Zijian Huang +1

cs.CV2024

VideoDPO: Omni-Preference Alignment for Video Diffusion Generation

Runtao Liu, Haoyu Wu, Zheng Ziqiang +4

cs.RO2026

FlyAware: Inertia-Aware Aerial Manipulation via Vision-Based Estimation and Post-Grasp Adaptation

Biyu Ye, Na Fan, Zhengping Fan +4

cs.CV2022

Deep Reinforced Attention Learning for Quality-Aware Visual Recognition

Duo Li, Qifeng Chen

cs.CV2024

Real-time 3D-aware Portrait Editing from a Single Image

Qingyan Bai, Zifan Shi, Yinghao Xu +7

cs.CV2023

Blind Video Deflickering by Neural Filtering with a Flawed Atlas

Chenyang Lei, Xuanchi Ren, Zhaoxiang Zhang +1

cs.CV2023

Human MotionFormer: Transferring Human Motions with Vision Transformers

Hongyu Liu, Xintong Han, Chengbin Jin +8

cs.CV2023

Bootstrap Motion Forecasting With Self-Consistent Constraints

Maosheng Ye, Jiamiao Xu, Xunnong Xu +3

cs.CV2023

Real-time 6K Image Rescaling with Rate-distortion Optimization

Chenyang Qi, Xin Yang, Ka Leong Cheng +2

cs.CV2018

Semi-parametric Image Synthesis

Xiaojuan Qi, Qifeng Chen, Jiaya Jia +1

cs.RO2023

Rotating without Seeing: Towards In-hand Dexterity through Touch

Zhao-Heng Yin, Binghao Huang, Yuzhe Qin +2

cs.CV2026

AvatarPointillist: AutoRegressive 4D Gaussian Avatarization

Hongyu Liu, Xuan Wang, Zijian Wu +7

cs.CV2026

InsEdit: Towards Instruction-based Visual Editing via Data-Efficient Video Diffusion Models Adaptation

Zhefan Rao, Bin Zou, Haoxuan Che +5

cs.CV2025

LDM-ISP: Enhancing Neural ISP for Low Light with Latent Diffusion Models

Qiang Wen, Zhefan Rao, Yazhou Xing +1

cs.CV2025

SkillMimic: Learning Basketball Interaction Skills from Demonstrations

Yinhuai Wang, Qihan Zhao, Runyi Yu +10

cs.AI2024

Diffusion-Based Visual Art Creation: A Survey and New Perspectives

Bingyuan Wang, Qifeng Chen, Zeyu Wang

cs.CV2024

Towards Degradation-Robust Reconstruction in Generalizable NeRF

Chan Ho Park, Ka Leong Cheng, Zhicheng Wang +1

cs.RO2026

Switch: Learning Agile Skills Switching for Humanoid Robots

Yuen-Fui Lau, Qihan Zhao, Yinhuai Wang +4

cs.CV2023

MetaPortrait: Identity-Preserving Talking Head Generation with Fast Personalized Adaptation

Bowen Zhang, Chenyang Qi, Pan Zhang +6

cs.CV2022

High-fidelity 3D GAN Inversion by Pseudo-multi-view Optimization

Jiaxin Xie, Hao Ouyang, Jingtan Piao +2

cs.CV2026

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Jianmin Chen, Jiaqi Tang, Wei Wei +9

cs.CV2023

Robust Reflection Removal with Flash-only Cues in the Wild

Chenyang Lei, Xudong Jiang, Qifeng Chen

cs.CV2024

GIC: Gaussian-Informed Continuum for Physical Property Identification and Simulation

Junhao Cai, Yuji Yang, Weihao Yuan +5

cs.CV2020

Learning to Learn Parameterized Classification Networks for Scalable Input Images

Duo Li, Anbang Yao, Qifeng Chen

cs.LG2021

Attack-Resistant Federated Learning with Residual-based Reweighting

Shuhao Fu, Chulin Xie, Bo Li +1

cs.CV2018

Single Image Reflection Separation with Perceptual Losses

Xuaner Zhang, Ren Ng, Qifeng Chen

cs.NE2021

Evaluating adversarial robustness in simulated cerebellum

Liu Yuezhang, Bo Li, Qifeng Chen

cs.CV2025

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

Mingzhe Zheng, Yongqi Xu, Haojian Huang +8

cs.GR2026

Controllable Video Generation: A Survey

Yue Ma, Kunyu Feng, Zhongyuan Hu +19

cs.CV2023

TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering

Jingye Chen, Yupan Huang, Tengchao Lv +3

cs.CV2021

A Categorized Reflection Removal Dataset with Diverse Real-world Scenes

Chenyang Lei, Xuhua Huang, Chenyang Qi +4

cs.CV2025

Model as a Game: On Numerical and Spatial Consistency for Generative Games

Jingye Chen, Yuzhong Zhao, Yupan Huang +5

cs.RO2023

Flipbot: Learning Continuous Paper Flipping via Coarse-to-Fine Exteroceptive-Proprioceptive Exploration

Chao Zhao, Chunli Jiang, Junhao Cai +3

cs.CL2022

Automatic Speech Recognition Datasets in Cantonese: A Survey and New Dataset

Tiezheng Yu, Rita Frieske, Peng Xu +9

cs.CV2021

FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation

Yisheng He, Haibin Huang, Haoqiang Fan +2

cs.CV2024

Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution Adaptation

Lanqing Guo, Yingqing He, Haoxin Chen +9

cs.AI2024

LLMs Meet Multimodal Generation and Editing: A Survey

Yingqing He, Zhaoyang Liu, Jingye Chen +13

cs.CV2025

Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising

Yifan Wang, Liya Ji, Zhanghan Ke +3

cs.CV2025

RGE-GS: Reward-Guided Expansive Driving Scene Reconstruction via Diffusion Priors

Sicong Du, Jiarun Liu, Qifeng Chen +3

cs.CV2020

Polarized Reflection Removal with Perfect Alignment in the Wild

Chenyang Lei, Xuhua Huang, Mengdi Zhang +3

cs.CV2022

One Model to Edit Them All: Free-Form Text-Driven Image Manipulation with Semantic Modulations

Yiming Zhu, Hongyu Liu, Yibing Song +5

cs.CV2022

Deep Video Prior for Video Consistency and Propagation

Chenyang Lei, Yazhou Xing, Hao Ouyang +1

cs.CV2024

Latent Guard: a Safety Framework for Text-to-image Generation

Runtao Liu, Ashkan Khakzar, Jindong Gu +3

eess.SP2021

Physics Assisted Deep Learning for Indoor Imaging using Phaseless Wi-Fi Measurements

Samruddhi Deshmukh, Amartansh Dubey, Dingfei Ma +2

cs.CV2026

EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation

Yue Ma, Xu Ye, Qinghe Wang +9

cs.CV2023

In-Domain GAN Inversion for Faithful Reconstruction and Editability

Jiapeng Zhu, Yujun Shen, Yinghao Xu +3

cs.CV2026

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

Bodong Du, Bowen Liu, Yang Yu +8

eess.IV2022

Optimizing Image Compression via Joint Learning with Denoising

Ka Leong Cheng, Yueqi Xie, Qifeng Chen

cs.MM2026

AudioX: A Unified Framework for Anything-to-Audio Generation

Zeyue Tian, Zhaoyang Liu, Yizhu Jin +6

cs.RO2025

Threat-Aware UAV Dodging of Human-Thrown Projectiles with an RGB-D Camera

Yuying Zhang, Na Fan, Haowen Zheng +4

cs.CV2020

Video Depth Estimation by Fusing Flow-to-Depth Proposals

Jiaxin Xie, Chenyang Lei, Zhuwen Li +2

cs.CV2021

Safety-aware Motion Prediction with Unseen Vehicles for Autonomous Driving

Xuanchi Ren, Tao Yang, Li Erran Li +2

cs.CV2023

LinkGAN: Linking GAN Latents to Pixels for Controllable Image Synthesis

Jiapeng Zhu, Ceyuan Yang, Yujun Shen +4

cs.CV2021

Joint Depth and Normal Estimation from Real-world Time-of-flight Raw Data

Rongrong Gao, Na Fan, Changlin Li +2

cs.CV2022

Rodin: A Generative Model for Sculpting 3D Digital Avatars Using Diffusion

Tengfei Wang, Bo Zhang, Ting Zhang +8

cs.CV2024

4D Panoptic Scene Graph Generation

Jingkang Yang, Jun Cen, Wenxuan Peng +6

cs.CV2024

Robust Depth Enhancement via Polarization Prompt Fusion Tuning

Kei Ikemura, Yiming Huang, Felix Heide +3

cs.CV2014

1-HKUST: Object Detection in ILSVRC 2014

Cewu Lu, Hao Chen, Qifeng Chen +3

cs.CV2024

HR Human: Modeling Human Avatars with Triangular Mesh and High-Resolution Textures from Videos

Qifeng Chen, Rengan Xie, Kai Huang +4

cs.GR2025

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

Kien T. Pham, Yingqing He, Yazhou Xing +2

cs.CV2026

Follow-Your-Shape: Shape-Aware Image Editing via Trajectory-Guided Region Control

Zeqian Long, Mingzhe Zheng, Kunyu Feng +6

cs.CV2021

Image Inpainting with External-internal Learning and Monochromic Bottleneck

Tengfei Wang, Hao Ouyang, Qifeng Chen

cs.CV2023

Online Overexposed Pixels Hallucination in Videos with Adaptive Reference Frame Selection

Yazhou Xing, Amrita Mazumdar, Anjul Patney +5