NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (149)

cs.CV2022

BEVFormer v2: Adapting Modern Image Backbones to Bird's-Eye-View Recognition via Perspective Supervision

Chenyu Yang, Yuntao Chen, Hao Tian +9

cs.CV2017

Deformable Convolutional Networks

Jifeng Dai, Haozhi Qi, Yuwen Xiong +4

cs.CV2024

MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Fanqing Meng, Jin Wang, Chuanhao Li +9

cs.CV2024

Learning 1D Causal Visual Representation with De-focus Attention Networks

Chenxin Tao, Xizhou Zhu, Shiqian Su +8

cs.CV2022

VL-LTR: Learning Class-wise Visual-Linguistic Representation for Long-Tailed Visual Recognition

Changyao Tian, Wenhai Wang, Xizhou Zhu +2

cs.CV2025

Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space

Yan Li, Changyao Tian, Renqiu Xia +7

cs.CL2026

MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling

MiroMind Team, Song Bai, Lidong Bing +52

cs.CV2025

VisualPRM: An Effective Process Reward Model for Multimodal Reasoning

Weiyun Wang, Zhangwei Gao, Lianjie Chen +12

cs.CV2024

Needle In A Multimodal Haystack

Weiyun Wang, Shuibo Zhang, Yiming Ren +13

cs.CV2025

Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding

Zhaokai Wang, Xizhou Zhu, Xue Yang +8

cs.CV2023

Planning-oriented Autonomous Driving

Yihan Hu, Jiazhi Yang, Li Chen +13

cs.CV2025

DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving

Erfei Cui, Wenhai Wang, Zhiqi Li +7

cs.CV2016

Instance-sensitive Fully Convolutional Networks

Jifeng Dai, Kaiming He, Yi Li +2

cs.CV2015

Convolutional Feature Masking for Joint Object and Stuff Segmentation

Jifeng Dai, Kaiming He, Jian Sun

cs.CV2018

Towards High Performance Video Object Detection for Mobiles

Xizhou Zhu, Jifeng Dai, Xingchi Zhu +2

cs.CV2024

MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer

Changyao Tian, Xizhou Zhu, Yuwen Xiong +10

cs.CV2015

Generative Modeling of Convolutional Neural Networks

Jifeng Dai, Yang Lu, Ying-Nian Wu

cs.CV2023

The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World

Weiyun Wang, Min Shi, Qingyun Li +11

cs.AI2023

Ghost in the Minecraft: Generally Capable Agents for Open-World Environments via Large Language Models with Text-based Knowledge and Memory

Xizhou Zhu, Yuntao Chen, Hao Tian +10

cs.CV2020

Hierarchical Human Parsing with Typed Part-Relation Reasoning

Wenguan Wang, Hailong Zhu, Jifeng Dai +3

cs.CV2015

BoxSup: Exploiting Bounding Boxes to Supervise Convolutional Networks for Semantic Segmentation

Jifeng Dai, Kaiming He, Jian Sun

cs.CV2024

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing +10

cs.CV2023

InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language

Zhaoyang Liu, Yinan He, Wenhai Wang +17

cs.CV2023

InstructSeq: Unifying Vision Tasks with Instruction-conditioned Multi-modal Sequence Generation

Rongyao Fang, Shilin Yan, Zhaoyang Huang +4

cs.CV2023

JourneyDB: A Benchmark for Generative Image Understanding

Keqiang Sun, Junting Pan, Yuying Ge +11

cs.CV2021

Exploring Cross-Image Pixel Contrast for Semantic Segmentation

Wenguan Wang, Tianfei Zhou, Fisher Yu +3

cs.CV2025

VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Weiye Xu, Jiahao Wang, Weiyun Wang +10

cs.CV2024

big.LITTLE Vision Transformer for Efficient Visual Recognition

He Guo, Yulong Wang, Zixuan Ye +2

cs.RO2024

RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis

Yao Mu, Junting Chen, Qinglong Zhang +16

cs.CV2025

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Zhe Chen, Weiyun Wang, Yue Cao +39

cs.CV2022

ConvMAE: Masked Convolution Meets Masked Autoencoders

Peng Gao, Teli Ma, Hongsheng Li +3

cs.CV2023

InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions

Wenhai Wang, Jifeng Dai, Zhe Chen +9

cs.CV2025

Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning

Chongjie Si, Xuehui Wang, Xue Yang +6

cs.CV2023

VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks

Wenhai Wang, Zhe Chen, Xiaokang Chen +8

cs.CV2024

Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications

Yuwen Xiong, Zhiqi Li, Yuntao Chen +10

cs.CV2018

Relation Networks for Object Detection

Han Hu, Jiayuan Gu, Zheng Zhang +2

cs.CV2022

Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information

Weijie Su, Xizhou Zhu, Chenxin Tao +7

cs.CV2021

Uni-Perceiver: Pre-training Unified Architecture for Generic Perception for Zero-shot and Few-shot Tasks

Xizhou Zhu, Jinguo Zhu, Hao Li +5

cs.CV2023

FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow Estimation

Xiaoyu Shi, Zhaoyang Huang, Dasong Li +6

cs.CV2020

Resolution Adaptive Networks for Efficient Inference

Le Yang, Yizeng Han, Xi Chen +3

cs.CV2024

Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang +4

cs.CV2024

Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments

Yang Yang, Wenhai Wang, Zhe Chen +2

cs.CV2025

MI-DETR: An Object Detection Model with Multi-time Inquiries Mechanism

Zhixiong Nan, Xianghong Li, Jifeng Dai +1

cs.CV2024

Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point Supervision

Yi Yu, Xue Yang, Qingyun Li +4

cs.RO2026

Driving Intents Amplify Planning-Oriented Reinforcement Learning

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang +4

cs.CV2020

Deformable Kernels: Adapting Effective Receptive Fields for Object Deformation

Hang Gao, Xizhou Zhu, Steve Lin +1

cs.CV2024

PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models

Chenyu Yang, Xuan Dong, Xizhou Zhu +7

cs.CV2021

FuseFormer: Fusing Fine-Grained Information in Transformers for Video Inpainting

Rui Liu, Hanming Deng, Yangyi Huang +6

cs.CV2022

Uni-Perceiver v2: A Generalist Model for Large-Scale Vision and Vision-Language Tasks

Hao Li, Jinguo Zhu, Xiaohu Jiang +8

cs.AI2025

ZeroGUI: Automating Online GUI Learning at Zero Human Cost

Chenyu Yang, Shiqian Su, Shi Liu +11

cs.CV2017

Flow-Guided Feature Aggregation for Video Object Detection

Xizhou Zhu, Yujie Wang, Jifeng Dai +2

cs.CV2024

DI-MaskDINO: A Joint Object Detection and Instance Segmentation Model

Zhixiong Nan, Xianghong Li, Tao Xiang +1

cs.CV2023

ControlLLM: Augment Language Models with Tools by Searching on Graphs

Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao +8

cs.CV2024

OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text

Qingyun Li, Zhe Chen, Weiyun Wang +37

cs.CV2024

ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process

Changyao Tian, Chenxin Tao, Jifeng Dai +7

cs.CV2023

Video Dehazing via a Multi-Range Temporal Alignment Network with Physical Prior

Jiaqi Xu, Xiaowei Hu, Lei Zhu +4

cs.RO2025

Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong +8

cs.CV2025

MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents

Xuehui Wang, Zhenyu Wu, JingJing Xie +25

cs.CV2024

How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Zhe Chen, Weiyun Wang, Hao Tian +32

cs.CV2023

FeatAug-DETR: Enriching One-to-Many Matching for DETRs with Feature Augmentation

Rongyao Fang, Peng Gao, Aojun Zhou +4

cs.RO2026

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

Yuzhou Huang, Benjin Zhu, Hengtong Lu +6

cs.CV2018

Integrated Object Detection and Tracking with Tracklet-Conditioned Detection

Zheng Zhang, Dazhi Cheng, Xizhou Zhu +2

cs.CV2017

Towards High Performance Video Object Detection

Xizhou Zhu, Jifeng Dai, Lu Yuan +1

cs.CV2021

Deformable DETR: Deformable Transformers for End-to-End Object Detection

Xizhou Zhu, Weijie Su, Lewei Lu +3

cs.RO2025

OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis

Junting Chen, Haotian Liang, Lingxiao Du +8

cs.CV2025

Demystify Transformers & Convolutions in Modern Image Deep Networks

Xiaowei Hu, Min Shi, Weiyun Wang +9

cs.CV2023

Denoising Diffusion Semantic Segmentation with Mask Prior Modeling

Zeqiang Lai, Yuchen Duan, Jifeng Dai +5

cs.CV2025

InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency

Weiyun Wang, Zhangwei Gao, Lixin Gu +72

cs.CV2022

Siamese Image Modeling for Self-Supervised Vision Representation Learning

Chenxin Tao, Xizhou Zhu, Weijie Su +6

cs.CV2025

CoMemo: LVLMs Need Image Context with Image Memory

Shi Liu, Weijie Su, Xizhou Zhu +2

cs.LG2021

Influence Selection for Active Learning

Zhuoming Liu, Hao Ding, Huaping Zhong +3

cs.CV2025

Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training

Gen Luo, Xue Yang, Wenhan Dou +5

cs.CV2017

Deep Feature Flow for Video Recognition

Xizhou Zhu, Yuwen Xiong, Jifeng Dai +2

cs.RO2025

Diffusion Transformer Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong +6

cs.CV2015

Instance-aware Semantic Segmentation via Multi-task Network Cascades

Jifeng Dai, Kaiming He, Jian Sun

cs.CV2026

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Ganlin Yang, Tianyi Zhang, Haoran Hao +15

cs.CV2024

V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding

Junqi Ge, Ziyi Chen, Jintao Lin +4

cs.CV2025

HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding

Chenxin Tao, Shiqian Su, Xizhou Zhu +8

cs.CV2025

InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models

Nianchen Deng, Lixin Gu, Shenglong Ye +17

cs.RO2025

Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy

Tianyi Zhang, Haonan Duan, Haoran Hao +3

cs.CV2020

VL-BERT: Pre-training of Generic Visual-Linguistic Representations

Weijie Su, Xizhou Zhu, Yue Cao +4

cs.CV2018

Deformable ConvNets v2: More Deformable, Better Results

Xizhou Zhu, Han Hu, Stephen Lin +1

cs.CV2024

Parameter-Inverted Image Pyramid Networks

Xizhou Zhu, Xue Yang, Zhaokai Wang +6

cs.CV2020

Auto Seg-Loss: Searching Metric Surrogates for Semantic Segmentation

Hao Li, Chenxin Tao, Xizhou Zhu +3

cs.CV2023

VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow Estimation

Xiaoyu Shi, Zhaoyang Huang, Weikang Bian +7

cs.CL2021

Scalable Transformers for Neural Machine Translation

Peng Gao, Shijie Geng, Yu Qiao +3

cs.CV2025

InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Jinguo Zhu, Weiyun Wang, Zhe Chen +48

cs.CV2023

FlowFormer: A Transformer Architecture and Its Masked Cost Volume Autoencoding for Optical Flow

Zhaoyang Huang, Xiaoyu Shi, Chao Zhang +6

cs.RO2026

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

Haiming Zhang, Junfei Zhou, Feng Jiang +6

cs.RO2023

EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought

Yao Mu, Qinglong Zhang, Mengkang Hu +7

cs.CV2024

PUMA: Empowering Unified MLLM with Multi-granular Visual Generation

Rongyao Fang, Chengqi Duan, Kun Wang +7

cs.CV2021

AutoLoss-Zero: Searching Loss Functions from Scratch for Generic Tasks

Hao Li, Tianwen Fu, Jifeng Dai +3

cs.AI2024

LLMs Meet Multimodal Generation and Editing: A Survey

Yingqing He, Zhaoyang Liu, Jingye Chen +13

cs.CV2017

Fully Convolutional Instance-aware Semantic Segmentation

Yi Li, Haozhi Qi, Jifeng Dai +2

cs.CV2024

SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding

Hao Li, Changyao Tian, Jie Shao +8

cs.CV2026

GenExam: A Multidisciplinary Text-to-Image Exam

Zhaokai Wang, Penghao Yin, Xiangyu Zhao +5

cs.CV2020

1st Place Solution of LVIS Challenge 2020: A Good Box is not a Guarantee of a Good Mask

Jingru Tan, Gang Zhang, Hanming Deng +4

cs.CL2025

Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Weiyun Wang, Zhe Chen, Wenhai Wang +8

cs.CV2020

Mining Cross-Image Semantics for Weakly Supervised Semantic Segmentation

Guolei Sun, Wenguan Wang, Jifeng Dai +1

cs.CV2025

Spatial Frequency Modulation for Semantic Segmentation

Linwei Chen, Ying Fu, Lin Gu +2