Simple data balancing achieves competitive worst-group-accuracy
arXiv:2110.14503
Abstract
We study the problem of learning classifiers that perform well across (known or unknown) groups of data. After observing that common worst-group-accuracy datasets suffer from substantial imbalances, we set out to compare state-of-the-art methods to simple balancing of classes and groups by either subsampling or reweighting data. Our results show that these data balancing baselines achieve state-of-the-art-accuracy, while being faster to train and requiring no additional hyper-parameters. In addition, we highlight that access to group information is most critical for model selection purposes, and not so much during training. All in all, our findings beg closer examination of benchmarks and methods for research in worst-group-accuracy optimization.
Accepted at CLeaR (Causal Learning and Reasoning) 2022
References in corpus (10)
- Shortcut Learning in Deep Neural Networks
- The Pitfalls of Simplicity Bias in Neural Networks
- In Search of Lost Domain Generalization
- An Investigation of Why Overparameterization Exacerbates Spurious Correlations
- Learning from Failure: Training Debiased Classifier from Biased Classifier
- No Subclass Left Behind: Fine-Grained Robustness in Coarse-Grained Classification Problems
- Gradient Starvation: A Learning Proclivity in Neural Networks
- Exploring Algorithmic Fairness in Robust Graph Covering Problems
- Algorithmic Bias and Data Bias: Understanding the Relation between Distributionally Robust Optimization and Data Curation
- Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification