NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (35)

cs.CV2026

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

Roy Xie, Dan Friedman, Donghan Yu +7

cs.CV2017

Fused DNN: A deep neural network fusion approach to fast and robust pedestrian detection

Xianzhi Du, Mostafa El-Khamy, Jungwon Lee +1

cs.CV2021

Towards a Unified Foundation Model: Jointly Pre-Training Transformers on Unpaired Images and Text

Qing Li, Boqing Gong, Yin Cui +4

cs.CV2024

Guiding Instruction-based Image Editing via Multimodal Large Language Models

Tsu-Jui Fu, Wenze Hu, Xianzhi Du +3

cs.CV2022

Optimizing Anchor-based Detectors for Autonomous Driving Scenes

Xianzhi Du, Wei-Chih Hung, Tsung-Yi Lin

cs.LG2025

Apple Intelligence Foundation Language Models: Tech Report 2025

Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395

cs.CV2023

Ferret: Refer and Ground Anything Anywhere at Any Granularity

Haoxuan You, Haotian Zhang, Zhe Gan +6

cs.CV2020

Efficient Scale-Permuted Backbone with Learned Resource Distribution

Xianzhi Du, Tsung-Yi Lin, Pengchong Jin +4

cs.AI2026

Apple Intelligence Foundation Language Models

Tom Gunter, Zirui Wang, Chong Wang +152

cs.CV2024

VeCLIP: Improving CLIP Training via Visual-enriched Captions

Zhengfeng Lai, Haotian Zhang, Bowen Zhang +9

cs.CV2021

Dilated SpineNet for Semantic Segmentation

Abdullah Rashwan, Xianzhi Du, Xiaoqi Yin +1

cs.LG2024

Revisiting MoE and Dense Speed-Accuracy Comparisons for LLM Training

Xianzhi Du, Tom Gunter, Xiang Kong +5

cs.LG2022

Provable Stochastic Optimization for Global Contrastive Learning: Small Batch Does Not Harm Performance

Zhuoning Yuan, Yuexin Wu, Zi-Hao Qiu +4

cs.CV2020

SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization

Xianzhi Du, Tsung-Yi Lin, Pengchong Jin +5

cs.CV2024

MOFI: Learning Image Representations from Noisy Entity Annotated Images

Wentao Wu, Aleksei Timofeev, Chen Chen +8

cs.CL2026

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

Xinyu Zhu, Yihao Feng, Yanchao Sun +5

cs.LG2026

AXLearn: Modular, Hardware-Agnostic Large Model Training

Mark Lee, Chang Lan, Tom Gunter +34

cs.CV2023

Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts

Erik Daxberger, Floris Weers, Bowen Zhang +7

cs.CV2025

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

Yanghao Li, Rui Qian, Bowen Pan +24

cs.CV2018

Fused Deep Neural Networks for Efficient Pedestrian Detection

Xianzhi Du, Mostafa El-Khamy, Vlad I. Morariu +2

cs.CV2025

CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling

Xinze Wang, Chen Chen, Yinfei Yang +5

cs.CV2023

Less is More: Removing Text-regions Improves CLIP Training Efficiency and Robustness

Liangliang Cao, Bowen Zhang, Chen Chen +5

cs.CL2024

Compressing LLMs: The Truth is Rarely Pure and Never Simple

Ajay Jaiswal, Zhe Gan, Xianzhi Du +3

cs.CV2022

A Simple Single-Scale Vision Transformer for Object Localization and Instance Segmentation

Wuyang Chen, Xianzhi Du, Fan Yang +8

cs.LG2025

Finding Fantastic Experts in MoEs: A Unified Study for Expert Dropping Strategies and Observations

Ajay Jaiswal, Jianyu Wang, Yixiao Li +6

cs.CV2024

MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Haotian Zhang, Mingfei Gao, Zhe Gan +20

cs.CV2024

MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training

Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier +29

cs.LG2022

Auto-scaling Vision Transformers without Training

Wuyang Chen, Wei Huang, Xianzhi Du +3

cs.CV2021

Revisiting 3D ResNets for Video Recognition

Xianzhi Du, Yeqing Li, Yin Cui +3

cs.CV2021

Revisiting ResNets: Improved Training and Scaling Strategies

Irwan Bello, William Fedus, Xianzhi Du +5

cs.CV2019

AMNet: Deep Atrous Multiscale Stereo Disparity Estimation Networks

Xianzhi Du, Mostafa El-Khamy, Jungwon Lee

cs.CV2021

Simple Training Strategies and Model Scaling for Object Detection

Xianzhi Du, Barret Zoph, Wei-Chih Hung +1

cs.CV2019

TW-SMNet: Deep Multitask Learning of Tele-Wide Stereo Matching

Mostafa El-Khamy, Haoyu Ren, Xianzhi Du +1

cs.CV2018

Boundary-sensitive Network for Portrait Segmentation

Xianzhi Du, Xiaolong Wang, Dawei Li +5

cs.CL2025

IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining

Yixiao Li, Xianzhi Du, Ajay Jaiswal +4