NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (116)

cs.CV2018

Context-Aware Synthesis and Placement of Object Instances

Donghoon Lee, Sifei Liu, Jinwei Gu +3

cs.CV2015

Layered Interpretation of Street View Images

Ming-Yu Liu, Shuoxin Lin, Srikumar Ramalingam +1

cs.CV2025

MFM-point: Multi-scale Flow Matching for Point Cloud Generation

Petr Molodyk, Jaemoo Choi, David W. Romero +2

cs.LG2025

Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling

Kaiwen Zheng, Yongxin Chen, Hanzi Mao +3

cs.RO2026

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

Jiangran Lyu, Kai Liu, Xuheng Zhang +20

cs.CV2018

Reblur2Deblur: Deblurring Videos via Self-Supervised Learning

Huaijin Chen, Jinwei Gu, Orazio Gallo +3

cs.CL2020

Style Example-Guided Text Generation using Generative Adversarial Transformers

Kuo-Hao Zeng, Mohammad Shoeybi, Ming-Yu Liu

cs.CV2017

Detecting Adversarial Attacks on Neural Network Policies with Visual Foresight

Yen-Chen Lin, Ming-Yu Liu, Min Sun +1

cs.CV2025

Cosmos World Foundation Model Platform for Physical AI

NVIDIA, :, Niket Agarwal +76

cs.RO2026

PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation

Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian +4

cs.CV2021

One-Shot Free-View Neural Talking-Head Synthesis for Video Conferencing

Ting-Chun Wang, Arun Mallya, Ming-Yu Liu

cs.CV2026

Benchmarking Single-Factor Physical Video-to-Audio Generation

Tingle Li, Siddharth Gururani, Kevin J. Shih +6

cs.CV2026

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

Hongchi Xia, Xuan Li, Zhaoshuo Li +9

cs.SD2026

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +15

cs.CV2024

Visual Fact Checker: Enabling High-Fidelity Detailed Caption Generation

Yunhao Ge, Xiaohui Zeng, Jacob Samuel Huffman +3

cs.CV2025

Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control

NVIDIA, :, Hassan Abu Alhaija +38

cs.CV2021

Deep Marching Tetrahedra: a Hybrid Representation for High-Resolution 3D Shape Synthesis

Tianchang Shen, Jun Gao, Kangxue Yin +2

cs.LG2025

Wolf: Dense Video Captioning with a World Summarization Framework

Boyi Li, Ligeng Zhu, Ran Tian +20

cs.CV2020

Generative Adversarial Networks for Image and Video Synthesis: Algorithms and Applications

Ming-Yu Liu, Xun Huang, Jiahui Yu +2

cs.CV2018

Models Matter, So Does Training: An Empirical Study of CNNs for Optical Flow Estimation

Deqing Sun, Xiaodong Yang, Ming-Yu Liu +1

cs.RO2025

Scalable Policy Evaluation with Video World Models

Wei-Cheng Tseng, Jinwei Gu, Qinsheng Zhang +4

cs.CV2024

DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion Models

Muyang Li, Tianle Cai, Jiaxin Cao +7

cs.CV2020

UFO$^2$: A Unified Framework towards Omni-supervised Object Detection

Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +3

cs.CV2016

Learning to Remove Multipath Distortions in Time-of-Flight Range Images for a Robotic Arm Setup

Kilho Son, Ming-Yu Liu, Yuichi Taguchi

cs.LG2026

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

Kaiwen Zheng, Huayu Chen, Haotian Ye +7

cs.CV2019

PointFlow: 3D Point Cloud Generation with Continuous Normalizing Flows

Guandao Yang, Xun Huang, Zekun Hao +3

cs.CV2019

CityFlow: A City-Scale Benchmark for Multi-Target Multi-Camera Vehicle Tracking and Re-Identification

Zheng Tang, Milind Naphade, Ming-Yu Liu +6

cs.CV2026

Plenoptic Video Generation

Xiao Fu, Shitao Tang, Min Shi +5

cs.CV2026

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

Kaiwen Zheng, Yuji Wang, Qianli Ma +7

cs.CV2025

MambaVideo for Discrete Video Tokenization with Channel-Split Quantization

Dawit Mureja Argaw, Xian Liu, Joon Son Chung +2

cs.CV2026

Cosmos 3: Omnimodal World Models for Physical AI

NVIDIA, :, Aditi +293

cs.LG2023

ATT3D: Amortized Text-to-3D Object Synthesis

Jonathan Lorraine, Kevin Xie, Xiaohui Zeng +7

cs.CV2019

Meta-Sim: Learning to Generate Synthetic Datasets

Amlan Kar, Aayush Prakash, Ming-Yu Liu +6

cs.GR2024

Meshtron: High-Fidelity, Artist-Like 3D Mesh Generation at Scale

Zekun Hao, David W. Romero, Tsung-Yi Lin +1

cs.CV2021

GANcraft: Unsupervised 3D Neural Rendering of Minecraft Worlds

Zekun Hao, Arun Mallya, Serge Belongie +1

cs.RO2026

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

NVIDIA, :, Yan Wang +41

cs.CV2023

DiffCollage: Parallel Generation of Large Content with Diffusion Models

Qinsheng Zhang, Jiaming Song, Xun Huang +2

cs.CV2025

Dynamic Camera Poses and Where to Find Them

Chris Rockwell, Joseph Tung, Tsung-Yi Lin +3

cs.CV2025

ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary

Zeqi Gu, Yin Cui, Zhaoshuo Li +6

cs.CV2018

PWC-Net: CNNs for Optical Flow Using Pyramid, Warping, and Cost Volume

Deqing Sun, Xiaodong Yang, Ming-Yu Liu +1

eess.AS2026

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +19

cs.CV2017

Learning Binary Residual Representations for Domain-specific Video Streaming

Yi-Hsuan Tsai, Ming-Yu Liu, Deqing Sun +2

cs.CV2026

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

Jing Gu, Xian Liu, Yu Zeng +8

cs.CV2024

Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models

NVIDIA, :, Yuval Atzmon +29

cs.RO2025

DreamGen: Unlocking Generalization in Robot Learning through Video World Models

Joel Jang, Seonghyeon Ye, Zongyu Lin +25

cs.CV2017

Attentional Network for Visual Object Detection

Kota Hara, Ming-Yu Liu, Oncel Tuzel +1

cs.CV2022

Implicit Warping for Animation with Image Sets

Arun Mallya, Ting-Chun Wang, Ming-Yu Liu

cs.CV2025

A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation

Andrew Z. Wang, Songwei Ge, Tero Karras +2

cs.CV2018

High-Resolution Image Synthesis and Semantic Manipulation with Conditional GANs

Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +3

cs.CV2025

CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models

Qingqing Zhao, Yao Lu, Moo Jin Kim +12

cs.CV2020

World-Consistent Video-to-Video Synthesis

Arun Mallya, Ting-Chun Wang, Karan Sapra +1

cs.CV2019

Few-Shot Unsupervised Image-to-Image Translation

Ming-Yu Liu, Xun Huang, Arun Mallya +4

cs.CV2025

Describe Anything: Detailed Localized Image and Video Captioning

Long Lian, Yifan Ding, Yunhao Ge +8

cs.CV2025

Direct Discriminative Optimization: Your Likelihood-Based Visual Generative Model is Secretly a GAN Discriminator

Kaiwen Zheng, Yongxin Chen, Huayu Chen +4

cs.CV2018

Unsupervised Stylish Image Description Generation via Domain Layer Norm

Cheng Kuan Chen, Zhu Feng Pan, Min Sun +1

cs.CV2020

Instance-aware, Context-focused, and Memory-efficient Weakly Supervised Object Detection

Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +4

cs.RO2026

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

Shenyuan Gao, William Liang, Kaiyuan Zheng +27

cs.CV2018

Video-to-Video Synthesis

Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +4

cs.CV2018

Multimodal Unsupervised Image-to-Image Translation

Xun Huang, Ming-Yu Liu, Serge Belongie +1

cs.CV2023

Neuralangelo: High-Fidelity Neural Surface Reconstruction

Zhaoshuo Li, Thomas Müller, Alex Evans +4

cs.CV2023

Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning

Zhuolin Yang, Wei Ping, Zihan Liu +13

cs.CV2020

COCO-FUNIT: Few-Shot Unsupervised Image Translation with a Content Conditioned Style Encoder

Kuniaki Saito, Kate Saenko, Ming-Yu Liu

cs.CV2018

Localization-Aware Active Learning for Object Detection

Chieh-Chi Kao, Teng-Yok Lee, Pradeep Sen +1

cs.CV2024

JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image Generation

Yu Zeng, Vishal M. Patel, Haochen Wang +4

cs.CV2025

Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation

Lu Ling, Chen-Hsuan Lin, Tsung-Yi Lin +7

cs.LG2022

LNS-Madam: Low-Precision Training in Logarithmic Number System using Multiplicative Weight Update

Jiawei Zhao, Steve Dai, Rangharajan Venkatesan +6

cs.CV2018

Superpixel Sampling Networks

Varun Jampani, Deqing Sun, Ming-Yu Liu +2

cs.CV2026

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal +7

cs.CV2026

DuoGen: Towards General Purpose Interleaved Multimodal Generation

Min Shi, Xiaohui Zeng, Jiannan Huang +13

cs.CV2026

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Kaiwen Zheng, Guande He, Min Zhao +7

cs.CV2025

HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation

Hermann Kumbong, Xian Liu, Tsung-Yi Lin +6

cs.CV2018

A Closed-form Solution to Photorealistic Image Stylization

Yijun Li, Ming-Yu Liu, Xueting Li +2

cs.GR2025

Articulated Kinematics Distillation from Video Diffusion Models

Xuan Li, Qianli Ma, Tsung-Yi Lin +4

cs.CV2026

World Simulation with Video Foundation Models for Physical AI

NVIDIA, :, Arslan Ali +87

cs.CV2016

Coupled Generative Adversarial Networks

Ming-Yu Liu, Oncel Tuzel

cs.CV2016

Unsupervised Network Pretraining via Encoding Human Design

Ming-Yu Liu, Arun Mallya, Oncel C. Tuzel +1

cs.CV2018

Unsupervised Image-to-Image Translation Networks

Ming-Yu Liu, Thomas Breuel, Jan Kautz

cs.NE2021

Learning compositional functions via multiplicative weight updates

Jeremy Bernstein, Jiawei Zhao, Markus Meister +3

cs.CV2025

Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding

Haotian Xue, Yunhao Ge, Yu Zeng +4

cs.LG2019

Tactics of Adversarial Attack on Deep Reinforcement Learning Agents

Yen-Chen Lin, Zhang-Wei Hong, Yuan-Hong Liao +3

cs.CV2019

Neural Turtle Graphics for Modeling City Road Layouts

Hang Chu, Daiqing Li, David Acuna +6

cs.LG2026

AVO: Agentic Variation Operators for Autonomous Evolutionary Search

Terry Chen, Zhifan Ye, Bing Xu +20

cs.CV2024

Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models

Songwei Ge, Seungjun Nah, Guilin Liu +7

cs.CV2023

Magic3D: High-Resolution Text-to-3D Content Creation

Chen-Hsuan Lin, Jun Gao, Luming Tang +7

cs.CV2023

Learning to Relight Portrait Images via a Virtual Light Stage and Synthetic-to-Real Adaptation

Yu-Ying Yeh, Koki Nagano, Sameh Khamis +3

cs.CV2026

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Peiwen Zhang, Yufan Deng, Shangkun Sun +11

cs.AI2026

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin +8

cs.LG2021

On the distance between two neural networks and the stability of learning

Jeremy Bernstein, Arash Vahdat, Yisong Yue +1

cs.LG2020

UNAS: Differentiable Architecture Search Meets Reinforcement Learning

Arash Vahdat, Arun Mallya, Ming-Yu Liu +1

cs.CV2017

CASENet: Deep Category-Aware Semantic Edge Detection

Zhiding Yu, Chen Feng, Ming-Yu Liu +1

cs.SE2026

VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents

Bing Xu, Terry Chen, Fengzhe Zhou +12

cs.LG2026

NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning

Huayu Chen, Kaiwen Zheng, Qinsheng Zhang +8

cs.CV2025

Efficient Part-level 3D Object Generation via Dual Volume Packing

Jiaxiang Tang, Ruijie Lu, Zhaoshuo Li +7

cs.CV2017

Deep 360 Pilot: Learning a Deep Agent for Piloting through 360° Sports Video

Hou-Ning Hu, Yen-Chen Lin, Ming-Yu Liu +3

cs.CV2026

InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression

Haotian Ye, Qiyuan He, Jiaqi Han +12

cs.CV2023

eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers

Yogesh Balaji, Seungjun Nah, Xun Huang +10

cs.CV2024

Edify 3D: Scalable High-Quality 3D Asset Generation

NVIDIA, :, Maciej Bala +22

cs.CV2022

SPACE: Speech-driven Portrait Animation with Controllable Expression

Siddharth Gururani, Arun Mallya, Ting-Chun Wang +2

cs.CV2015

Deep Gaussian Conditional Random Field Network: A Model-based Deep Network for Discriminative Denoising

Raviteja Vemulapalli, Oncel Tuzel, Ming-Yu Liu

cs.RO2026

Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge

Junjie Bai, Yu-Wei Chao, Qizhi Chen +13