NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (110)

cs.CV2024

Improving Distant 3D Object Detection Using 2D Box Supervision

Zetong Yang, Zhiding Yu, Chris Choy +3

cs.CV2026

PhyCritic: Multimodal Critic Models for Physical AI

Tianyi Xiong, Shihao Wang, Guilin Liu +5

cs.LG2018

Deep Hyperspherical Learning

Weiyang Liu, Yan-Ming Zhang, Xingguo Li +4

cs.CV2020

Instance-aware, Context-focused, and Memory-efficient Weakly Supervised Object Detection

Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +4

cs.CV2024

A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties

Junfei Xiao, Ziqi Zhou, Wenxuan Li +6

cs.LG2024

Learning Calibrated Uncertainties for Domain Shift: A Distributionally Robust Learning Approach

Haoxuan Wang, Zhiding Yu, Yisong Yue +3

cs.RO2025

Hydra-NeXt: Robust Closed-Loop Driving with Open-Loop Training

Zhenxin Li, Shihao Wang, Shiyi Lan +3

cs.LG2025

NVIDIA Nemotron Nano V2 VL

NVIDIA, :, Amala Sanjay Deshmukh +121

cs.CV2026

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

Yunze Man, Shihao Wang, Guowen Zhang +7

stat.ML2017

Large-Margin Softmax Loss for Convolutional Neural Networks

Weiyang Liu, Yandong Wen, Zhiding Yu +1

cs.CV2024

Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?

Zhiqi Li, Zhiding Yu, Shiyi Lan +4

cs.CV2023

Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning

Zhuolin Yang, Wei Ping, Zihan Liu +13

cs.CV2021

Joint Discriminative and Generative Learning for Person Re-identification

Zhedong Zheng, Xiaodong Yang, Zhiding Yu +3

cs.CV2023

FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation

Zhiqi Li, Zhiding Yu, David Austin +4

cs.CV2018

Simultaneous Edge Alignment and Learning

Zhiding Yu, Weiyang Liu, Yang Zou +4

cs.CV2022

Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models

Manli Shu, Weili Nie, De-An Huang +4

cs.CV2023

FocalFormer3D : Focusing on Hard Instance for 3D Object Detection

Yilun Chen, Zhiding Yu, Yukang Chen +4

cs.CV2025

FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding

De-An Huang, Subhashree Radhakrishnan, Zhiding Yu +1

cs.CV2025

Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought

Yunze Man, De-An Huang, Guilin Liu +6

cs.CV2021

Not All Labels Are Equal: Rationalizing The Labeling Costs for Training Object Detection

Ismail Elezi, Zhiding Yu, Anima Anandkumar +2

cs.CV2024

Fully Attentional Networks with Self-emerging Token Labeling

Bingyin Zhao, Zhiding Yu, Shiyi Lan +4

cs.LG2021

SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies

Linxi Fan, Guanzhi Wang, De-An Huang +4

cs.CV2024

Memorize What Matters: Emergent Scene Decomposition from Multitraverse

Yiming Li, Zehong Wang, Yue Wang +5

cs.CV2020

Regularizing Neural Networks via Minimizing Hyperspherical Energy

Rongmei Lin, Weiyang Liu, Zhen Liu +5

cs.CV2016

Jointly Learning Non-negative Projection and Dictionary with Discriminative Graph Constraints for Classification

Weiyang Liu, Zhiding Yu, Yandong Wen +2

cs.CV2022

Understanding The Robustness in Vision Transformers

Daquan Zhou, Zhiding Yu, Enze Xie +4

cs.CV2024

SSCBench: A Large-Scale 3D Semantic Scene Completion Benchmark for Autonomous Driving

Yiming Li, Sihang Li, Xinhao Liu +11

cs.CV2026

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

Shihao Wang, Shilong Liu, Yuanguo Kuang +10

cs.CV2026

Stateful Token Reduction for Long-Video Hybrid VLMs

Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7

eess.IV2026

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

Letian Zhang, Sucheng Ren, Yanqing Liu +9

cs.CV2023

Vision Transformers Are Good Mask Auto-Labelers

Shiyi Lan, Xitong Yang, Zhiding Yu +3

cs.CV2018

Partial Convolution based Padding

Guilin Liu, Kevin J. Shih, Ting-Chun Wang +5

cs.CV2025

OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning

Shihao Wang, Zhiding Yu, Xiaohui Jiang +6

cs.CV2024

T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching

Zizheng Pan, Bohan Zhuang, De-An Huang +5

cs.LG2020

Angular Visual Hardness

Beidi Chen, Weiyang Liu, Zhiding Yu +4

cs.LG2020

Neural Networks with Recurrent Generative Feedback

Yujia Huang, James Gornet, Sihui Dai +4

cs.CV2025

Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation

Kailin Li, Zhenxin Li, Shiyi Lan +6

cs.CV2023

VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion

Yiming Li, Zhiding Yu, Christopher Choy +5

cs.CV2022

Panoptic SegFormer: Delving Deeper into Panoptic Segmentation with Transformers

Zhiqi Li, Wenhai Wang, Enze Xie +5

cs.IR2026

Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval

Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu +9

cs.AI2021

Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning

Weili Nie, Zhiding Yu, Lei Mao +3

cs.LG2025

Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training

Mingjie Liu, Shizhe Diao, Jian Hu +19

cs.CV2020

Confidence Regularized Self-Training

Yang Zou, Zhiding Yu, Xiaofeng Liu +2

cs.CV2019

Learning Strict Identity Mappings in Deep Residual Networks

Xin Yu, Zhiding Yu, Srikumar Ramalingam

cs.CV2020

Joint Disentangling and Adaptation for Cross-Domain Person Re-Identification

Yang Zou, Xiaodong Yang, Zhiding Yu +2

cs.CV2021

Contrastive Syn-to-Real Generalization

Wuyang Chen, Zhiding Yu, Shalini De Mello +4

cs.LG2013

Multi-Task Regularization with Covariance Dictionary for Linear Classifiers

Fanyi Xiao, Ruikun Luo, Zhiding Yu

cs.CV2025

AIDE: Agentically Improve Visual Language Model with Domain Experts

Ming-Chang Chiu, Fuxiao Liu, Karan Sapra +5

cs.CV2025

QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation

Yue Zhao, Fuzhao Xue, Scott Reed +6

cs.LG2020

Learning towards Minimum Hyperspherical Energy

Weiyang Liu, Rongmei Lin, Zhen Liu +4

cs.AI2026

ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents

Hao Zhang, Mingjie Liu, Shaokun Zhang +10

cs.CV2020

UFO$^2$: A Unified Framework towards Omni-supervised Object Detection

Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +3

cs.CV2018

SphereFace: Deep Hypersphere Embedding for Face Recognition

Weiyang Liu, Yandong Wen, Zhiding Yu +3

cs.CV2018

Domain Adaptation for Semantic Segmentation via Class-Balanced Self-Training

Yang Zou, Zhiding Yu, B. V. K. Vijaya Kumar +1

cs.CV2023

FB-BEV: BEV Representation from Forward-Backward View Transformations

Zhiqi Li, Zhiding Yu, Wenhai Wang +3

cs.CL2025

RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression

Payman Behnam, Yaosheng Fu, Ritchie Zhao +3

cs.CV2020

Delving Deeper into Anti-aliasing in ConvNets

Xueyan Zou, Fanyi Xiao, Zhiding Yu +1

cs.CV2025

Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models

Guo Chen, Zhiqi Li, Shihao Wang +16

cs.CV2025

Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders

Min Shi, Fuxiao Liu, Shihao Wang +13

cs.CV2017

CASENet: Deep Category-Aware Semantic Edge Detection

Zhiding Yu, Chen Feng, Ming-Yu Liu +1

cs.LG2020

Automated Synthetic-to-Real Generalization

Wuyang Chen, Zhiding Yu, Zhangyang Wang +1

cs.CV2023

Real-Time Radiance Fields for Single-Image Portrait View Synthesis

Alex Trevithick, Matthew Chan, Michael Stengel +7

cs.CV2015

Constructing the L2-Graph for Robust Subspace Learning and Subspace Clustering

Xi Peng, Zhiding Yu, Huajin Tang +1

cs.CV2021

DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision

Shiyi Lan, Zhiding Yu, Christopher Choy +5

cs.CL2025

Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning

Shaokun Zhang, Yi Dong, Jieyu Zhang +6

cs.CV2026

Cosmos 3: Omnimodal World Models for Physical AI

NVIDIA, :, Aditi +293

cs.CV2022

1st Place Solution of The Robust Vision Challenge 2022 Semantic Segmentation Track

Junfei Xiao, Zhichao Xu, Shiyi Lan +3

cs.LG2024

Prismer: A Vision-Language Model with Multi-Task Experts

Shikun Liu, Linxi Fan, Edward Johns +3

cs.CV2022

AugMax: Adversarial Composition of Random Augmentations for Robust Training

Haotao Wang, Chaowei Xiao, Jean Kossaifi +3

cs.RO2025

GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

NVIDIA, :, Johan Bjorck +40

cs.CV2024

LITA: Language Instructed Temporal-Localization Assistant

De-An Huang, Shijia Liao, Subhashree Radhakrishnan +4

cs.CV2025

Neural Eulerian Scene Flow Fields

Kyle Vedder, Neehar Peri, Ishan Khatri +7

cs.RO2025

Enhancing Autonomous Driving Safety with Collision Scenario Integration

Zi Wang, Shiyi Lan, Xinglong Sun +4

cs.CV2022

FreeSOLO: Learning to Segment Objects without Annotations

Xinlong Wang, Zhiding Yu, Shalini De Mello +4

cs.CV2024

Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation

Zhenxin Li, Kailin Li, Shihao Wang +9

cs.CV2025

StreamChat: Chatting with Streaming Video

Jihao Liu, Zhiding Yu, Shiyi Lan +5

cs.CV2018

Decoupled Networks

Weiyang Liu, Zhen Liu, Zhiding Yu +5

cs.CV2022

M$^2$BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified Birds-Eye View Representation

Enze Xie, Zhiding Yu, Daquan Zhou +5

cs.CV2014

KCRC-LCD: Discriminative Kernel Collaborative Representation with Locality Constrained Dictionary for Visual Categorization

Weiyang Liu, Zhiding Yu, Lijia Lu +3

cs.CV2022

Learning Contrastive Representation for Semantic Correspondence

Taihong Xiao, Sifei Liu, Shalini De Mello +3

cs.CV2025

Slow-Fast Architecture for Video Multi-Modal Large Language Models

Min Shi, Shihao Wang, Chieh-Yun Chen +6

cs.CV2022

RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning

Xiaojian Ma, Weili Nie, Zhiding Yu +5

cs.CV2025

Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models

Zhiqi Li, Guo Chen, Shilong Liu +24

cs.LG2022

Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions

Jiachen Sun, Qingzhao Zhang, Bhavya Kailkhura +3

cs.CV2026

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

Shihao Wang, Guo Chen, De-an Huang +6

cs.RO2025

Centaur: Robust End-to-End Autonomous Driving with Test-Time Training

Chonghao Sima, Kashyap Chitta, Zhiding Yu +5

cs.LG2021

Unsupervised Controllable Generation with Self-Training

Grigorios G Chrysos, Jean Kossaifi, Zhiding Yu +1

cs.CV2024

Exploring Camera Encoder Designs for Autonomous Driving Perception

Barath Lakshmanan, Joshua Chen, Shiyi Lan +3

cs.CV2024

What is Point Supervision Worth in Video Instance Segmentation?

Shuaiyi Huang, De-An Huang, Zhiding Yu +5

cs.CV2023

Differentially Private Video Activity Recognition

Zelun Luo, Yuliang Zou, Yijin Yang +6

cs.CV2021

SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers

Enze Xie, Wenhai Wang, Zhiding Yu +3

cs.CV2020

Uncertainty-aware multi-view co-training for semi-supervised medical image segmentation and domain adaptation

Yingda Xia, Dong Yang, Zhiding Yu +7

cs.CV2022

MinVIS: A Minimal Video Instance Segmentation Framework without Video-based Training

De-An Huang, Zhiding Yu, Anima Anandkumar

cs.CV2024

X-VILA: Cross-Modality Alignment for Large Language Model

Hanrong Ye, De-An Huang, Yao Lu +8

cs.LG2022

Taxonomy of Machine Learning Safety: A Survey and Primer

Sina Mohseni, Haotao Wang, Zhiding Yu +3

cs.CV2025

STORM: Token-Efficient Long Video Understanding for Multimodal LLMs

Jindong Jiang, Xiuyu Li, Zhijian Liu +13

cs.CV2022

CoordGAN: Self-Supervised Dense Correspondences Emerge from GANs

Jiteng Mu, Shalini De Mello, Zhiding Yu +4

cs.CV2021

Image-Level or Object-Level? A Tale of Two Resampling Strategies for Long-Tailed Detection

Nadine Chang, Zhiding Yu, Yu-Xiong Wang +3

cs.CV2014

Structured Hough Voting for Vision-based Highway Border Detection

Zhiding Yu, Wende Zhang, B. V. K. Vijaya Kumar +1

cs.RO2026

Vesta: A Generalist Embodied Reasoning Model

Johan Bjorck, Zhiqi Li, Yunze Man +29