Publications (110)
Improving Distant 3D Object Detection Using 2D Box Supervision
Zetong Yang, Zhiding Yu, Chris Choy +3
PhyCritic: Multimodal Critic Models for Physical AI
Tianyi Xiong, Shihao Wang, Guilin Liu +5
Deep Hyperspherical Learning
Weiyang Liu, Yan-Ming Zhang, Xingguo Li +4
Instance-aware, Context-focused, and Memory-efficient Weakly Supervised Object Detection
Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +4
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
Junfei Xiao, Ziqi Zhou, Wenxuan Li +6
Learning Calibrated Uncertainties for Domain Shift: A Distributionally Robust Learning Approach
Haoxuan Wang, Zhiding Yu, Yisong Yue +3
Hydra-NeXt: Robust Closed-Loop Driving with Open-Loop Training
Zhenxin Li, Shihao Wang, Shiyi Lan +3
NVIDIA Nemotron Nano V2 VL
NVIDIA, :, Amala Sanjay Deshmukh +121
LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
Yunze Man, Shihao Wang, Guowen Zhang +7
Large-Margin Softmax Loss for Convolutional Neural Networks
Weiyang Liu, Yandong Wen, Zhiding Yu +1
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
Zhiqi Li, Zhiding Yu, Shiyi Lan +4
Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning
Zhuolin Yang, Wei Ping, Zihan Liu +13
Joint Discriminative and Generative Learning for Person Re-identification
Zhedong Zheng, Xiaodong Yang, Zhiding Yu +3
FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation
Zhiqi Li, Zhiding Yu, David Austin +4
Simultaneous Edge Alignment and Learning
Zhiding Yu, Weiyang Liu, Yang Zou +4
Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models
Manli Shu, Weili Nie, De-An Huang +4
FocalFormer3D : Focusing on Hard Instance for 3D Object Detection
Yilun Chen, Zhiding Yu, Yukang Chen +4
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
De-An Huang, Subhashree Radhakrishnan, Zhiding Yu +1
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
Yunze Man, De-An Huang, Guilin Liu +6
Not All Labels Are Equal: Rationalizing The Labeling Costs for Training Object Detection
Ismail Elezi, Zhiding Yu, Anima Anandkumar +2
Fully Attentional Networks with Self-emerging Token Labeling
Bingyin Zhao, Zhiding Yu, Shiyi Lan +4
SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies
Linxi Fan, Guanzhi Wang, De-An Huang +4
Memorize What Matters: Emergent Scene Decomposition from Multitraverse
Yiming Li, Zehong Wang, Yue Wang +5
Regularizing Neural Networks via Minimizing Hyperspherical Energy
Rongmei Lin, Weiyang Liu, Zhen Liu +5
Jointly Learning Non-negative Projection and Dictionary with Discriminative Graph Constraints for Classification
Weiyang Liu, Zhiding Yu, Yandong Wen +2
Understanding The Robustness in Vision Transformers
Daquan Zhou, Zhiding Yu, Enze Xie +4
SSCBench: A Large-Scale 3D Semantic Scene Completion Benchmark for Autonomous Driving
Yiming Li, Sihang Li, Xinhao Liu +11
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
Shihao Wang, Shilong Liu, Yuanguo Kuang +10
Stateful Token Reduction for Long-Video Hybrid VLMs
Jindong Jiang, Amala Sanjay Deshmukh, Kateryna Chumachenko +7
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
Letian Zhang, Sucheng Ren, Yanqing Liu +9
Vision Transformers Are Good Mask Auto-Labelers
Shiyi Lan, Xitong Yang, Zhiding Yu +3
Partial Convolution based Padding
Guilin Liu, Kevin J. Shih, Ting-Chun Wang +5
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
Shihao Wang, Zhiding Yu, Xiaohui Jiang +6
T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
Zizheng Pan, Bohan Zhuang, De-An Huang +5
Angular Visual Hardness
Beidi Chen, Weiyang Liu, Zhiding Yu +4
Neural Networks with Recurrent Generative Feedback
Yujia Huang, James Gornet, Sihui Dai +4
Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
Kailin Li, Zhenxin Li, Shiyi Lan +6
VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion
Yiming Li, Zhiding Yu, Christopher Choy +5
Panoptic SegFormer: Delving Deeper into Panoptic Segmentation with Transformers
Zhiqi Li, Wenhai Wang, Enze Xie +5
Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval
Gabriel de Souza P. Moreira, Ronay Ak, Mengyao Xu +9
Bongard-LOGO: A New Benchmark for Human-Level Concept Learning and Reasoning
Weili Nie, Zhiding Yu, Lei Mao +3
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
Mingjie Liu, Shizhe Diao, Jian Hu +19
Confidence Regularized Self-Training
Yang Zou, Zhiding Yu, Xiaofeng Liu +2
Learning Strict Identity Mappings in Deep Residual Networks
Xin Yu, Zhiding Yu, Srikumar Ramalingam
Joint Disentangling and Adaptation for Cross-Domain Person Re-Identification
Yang Zou, Xiaodong Yang, Zhiding Yu +2
Contrastive Syn-to-Real Generalization
Wuyang Chen, Zhiding Yu, Shalini De Mello +4
Multi-Task Regularization with Covariance Dictionary for Linear Classifiers
Fanyi Xiao, Ruikun Luo, Zhiding Yu
AIDE: Agentically Improve Visual Language Model with Domain Experts
Ming-Chang Chiu, Fuxiao Liu, Karan Sapra +5
QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation
Yue Zhao, Fuzhao Xue, Scott Reed +6
Learning towards Minimum Hyperspherical Energy
Weiyang Liu, Rongmei Lin, Zhen Liu +4
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
Hao Zhang, Mingjie Liu, Shaokun Zhang +10
UFO$^2$: A Unified Framework towards Omni-supervised Object Detection
Zhongzheng Ren, Zhiding Yu, Xiaodong Yang +3
SphereFace: Deep Hypersphere Embedding for Face Recognition
Weiyang Liu, Yandong Wen, Zhiding Yu +3
Domain Adaptation for Semantic Segmentation via Class-Balanced Self-Training
Yang Zou, Zhiding Yu, B. V. K. Vijaya Kumar +1
FB-BEV: BEV Representation from Forward-Backward View Transformations
Zhiqi Li, Zhiding Yu, Wenhai Wang +3
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
Payman Behnam, Yaosheng Fu, Ritchie Zhao +3
Delving Deeper into Anti-aliasing in ConvNets
Xueyan Zou, Fanyi Xiao, Zhiding Yu +1
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
Guo Chen, Zhiqi Li, Shihao Wang +16
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
Min Shi, Fuxiao Liu, Shihao Wang +13
CASENet: Deep Category-Aware Semantic Edge Detection
Zhiding Yu, Chen Feng, Ming-Yu Liu +1
Automated Synthetic-to-Real Generalization
Wuyang Chen, Zhiding Yu, Zhangyang Wang +1
Real-Time Radiance Fields for Single-Image Portrait View Synthesis
Alex Trevithick, Matthew Chan, Michael Stengel +7
Constructing the L2-Graph for Robust Subspace Learning and Subspace Clustering
Xi Peng, Zhiding Yu, Huajin Tang +1
DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision
Shiyi Lan, Zhiding Yu, Christopher Choy +5
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
Shaokun Zhang, Yi Dong, Jieyu Zhang +6
Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA, :, Aditi +293
1st Place Solution of The Robust Vision Challenge 2022 Semantic Segmentation Track
Junfei Xiao, Zhichao Xu, Shiyi Lan +3
Prismer: A Vision-Language Model with Multi-Task Experts
Shikun Liu, Linxi Fan, Edward Johns +3
AugMax: Adversarial Composition of Random Augmentations for Robust Training
Haotao Wang, Chaowei Xiao, Jean Kossaifi +3
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
NVIDIA, :, Johan Bjorck +40
LITA: Language Instructed Temporal-Localization Assistant
De-An Huang, Shijia Liao, Subhashree Radhakrishnan +4
Neural Eulerian Scene Flow Fields
Kyle Vedder, Neehar Peri, Ishan Khatri +7
Enhancing Autonomous Driving Safety with Collision Scenario Integration
Zi Wang, Shiyi Lan, Xinglong Sun +4
FreeSOLO: Learning to Segment Objects without Annotations
Xinlong Wang, Zhiding Yu, Shalini De Mello +4
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
Zhenxin Li, Kailin Li, Shihao Wang +9
StreamChat: Chatting with Streaming Video
Jihao Liu, Zhiding Yu, Shiyi Lan +5
Decoupled Networks
Weiyang Liu, Zhen Liu, Zhiding Yu +5
M$^2$BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified Birds-Eye View Representation
Enze Xie, Zhiding Yu, Daquan Zhou +5
KCRC-LCD: Discriminative Kernel Collaborative Representation with Locality Constrained Dictionary for Visual Categorization
Weiyang Liu, Zhiding Yu, Lijia Lu +3
Learning Contrastive Representation for Semantic Correspondence
Taihong Xiao, Sifei Liu, Shalini De Mello +3
Slow-Fast Architecture for Video Multi-Modal Large Language Models
Min Shi, Shihao Wang, Chieh-Yun Chen +6
RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning
Xiaojian Ma, Weili Nie, Zhiding Yu +5
Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
Zhiqi Li, Guo Chen, Shilong Liu +24
Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions
Jiachen Sun, Qingzhao Zhang, Bhavya Kailkhura +3
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
Shihao Wang, Guo Chen, De-an Huang +6
Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
Chonghao Sima, Kashyap Chitta, Zhiding Yu +5
Unsupervised Controllable Generation with Self-Training
Grigorios G Chrysos, Jean Kossaifi, Zhiding Yu +1
Exploring Camera Encoder Designs for Autonomous Driving Perception
Barath Lakshmanan, Joshua Chen, Shiyi Lan +3
What is Point Supervision Worth in Video Instance Segmentation?
Shuaiyi Huang, De-An Huang, Zhiding Yu +5
Differentially Private Video Activity Recognition
Zelun Luo, Yuliang Zou, Yijin Yang +6
SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers
Enze Xie, Wenhai Wang, Zhiding Yu +3
Uncertainty-aware multi-view co-training for semi-supervised medical image segmentation and domain adaptation
Yingda Xia, Dong Yang, Zhiding Yu +7
MinVIS: A Minimal Video Instance Segmentation Framework without Video-based Training
De-An Huang, Zhiding Yu, Anima Anandkumar
X-VILA: Cross-Modality Alignment for Large Language Model
Hanrong Ye, De-An Huang, Yao Lu +8
Taxonomy of Machine Learning Safety: A Survey and Primer
Sina Mohseni, Haotao Wang, Zhiding Yu +3
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
Jindong Jiang, Xiuyu Li, Zhijian Liu +13
CoordGAN: Self-Supervised Dense Correspondences Emerge from GANs
Jiteng Mu, Shalini De Mello, Zhiding Yu +4
Image-Level or Object-Level? A Tale of Two Resampling Strategies for Long-Tailed Detection
Nadine Chang, Zhiding Yu, Yu-Xiong Wang +3
Structured Hough Voting for Vision-based Highway Border Detection
Zhiding Yu, Wende Zhang, B. V. K. Vijaya Kumar +1
Vesta: A Generalist Embodied Reasoning Model
Johan Bjorck, Zhiqi Li, Yunze Man +29