Measuring Robustness to Natural Distribution Shifts in Image Classification
arXiv:2007.00644
Abstract
We study how robust current ImageNet models are to distribution shifts arising from natural variations in datasets. Most research on robustness focuses on synthetic image perturbations (noise, simulated weather artifacts, adversarial examples, etc.), which leaves open how robustness on synthetic distribution shift relates to distribution shift arising in real data. Informed by an evaluation of 204 ImageNet models in 213 different test conditions, we find that there is often little to no transfer of robustness from current synthetic to natural distribution shift. Moreover, most current techniques provide no robustness to the natural distribution shifts in our testbed. The main exception is training on larger and more diverse datasets, which in multiple cases increases robustness, but is still far from closing the performance gaps. Our results indicate that distribution shifts arising in real data are currently an open research problem. We provide our testbed and data as a resource for future work at https://modestyachts.github.io/imagenet-testbed/ .
References in corpus (10)
- Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift
- Improved Regularization of Convolutional Neural Networks with Cutout
- Certified Adversarial Robustness via Randomized Smoothing
- Domain Generalization via Invariant Feature Representation
- Making Convolutional Networks Shift-Invariant Again
- Billion-scale semi-supervised learning for image classification
- No Classification without Representation: Assessing Geodiversity Issues in Open Data Sets for the Developing World
- YouTube-BoundingBoxes: A Large High-Precision Human-Annotated Data Set for Object Detection in Video
- Robustness to Spurious Correlations via Human Annotations
- Auditing ImageNet: Towards a Model-driven Framework for Annotating Demographic Attributes of Large-Scale Image Datasets
Cited by in corpus (9)
- Learning Transferable Visual Models From Natural Language Supervision
- The Fallacy of AI Functionality
- Assaying Out-Of-Distribution Generalization in Transfer Learning
- BREEDS: Benchmarks for Subpopulation Shift
- An Analysis of Deep Object Detectors For Diver Detection
- In-N-Out: Pre-Training and Self-Training using Auxiliary Information for Out-of-Distribution Robustness
- Towards Robust Off-Policy Evaluation via Human Inputs
- Learning Under Adversarial and Interventional Shifts
- Addressing Weak Decision Boundaries in Image Classification by Leveraging Web Search and Generative Models