GAIN: Missing Data Imputation using Generative Adversarial Nets
arXiv:1806.02920
Abstract
We propose a novel method for imputing missing data by adapting the well-known Generative Adversarial Nets (GAN) framework. Accordingly, we call our method Generative Adversarial Imputation Nets (GAIN). The generator (G) observes some components of a real data vector, imputes the missing components conditioned on what is actually observed, and outputs a completed vector. The discriminator (D) then takes a completed vector and attempts to determine which components were actually observed and which were imputed. To ensure that D forces G to learn the desired distribution, we provide D with some additional information in the form of a hint vector. The hint reveals to D partial information about the missingness of the original sample, which is used by D to focus its attention on the imputation quality of particular components. This hint ensures that G does in fact learn to generate according to the true data distribution. We tested our method on various datasets and found that GAIN significantly outperforms state-of-the-art imputation methods.
10 pages, 3 figures, 2018 International Conference of Machine Learning
Cited by in corpus (67)
- Synthesizing Tabular Data using Generative Adversarial Networks
- MAIN: Multihead-Attention Imputation Networks
- Missing Data Imputation with Adversarially-trained Graph Convolutional Networks
- Blockchain-based Digital Twins: Research Trends, Issues, and Future Challenges
- Graph Convolutional Networks for Graphs Containing Missing Features
- Maximizing information from chemical engineering data sets: Applications to machine learning
- Processing of missing data by neural networks
- Variational Autoencoder with Arbitrary Conditioning
- On the consistency of supervised learning with missing values
- Spatiotemporal Tensor Completion for Improved Urban Traffic Imputation
- Learning Neural Causal Models from Unknown Interventions
- STING: Self-attention based Time-series Imputation Networks using GAN
- Recovery of Future Data via Convolution Nuclear Norm Minimization
- PermuteAttack: Counterfactual Explanation of Machine Learning Credit Scorecards
- GP-VAE: Deep Probabilistic Time Series Imputation
- Networked Time Series Imputation via Position-aware Graph Enhanced Variational Autoencoders
- Reconstruction of Sentinel-2 Time Series Using Robust Gaussian Mixture Models -- Application to the Detection of Anomalous Crop Development in wheat and rapeseed crops
- Data Imputation with Iterative Graph Reconstruction
- Modeling Network-level Traffic Flow Transitions on Sparse Data
- What's a good imputation to predict with missing values?
- not-MIWAE: Deep Generative Modelling with Missing not at Random Data
- Improving Missing Data Imputation with Deep Generative Models
- Causal Discovery from Incomplete Data: A Deep Learning Approach
- Comparison of Missing Data Imputation Methods using the Framingham Heart study dataset
- Deep Generative Imputation Model for Missing Not At Random Data
- RDIS: Random Drop Imputation with Self-Training for Incomplete Time Series Data
- NAOMI: Non-Autoregressive Multiresolution Sequence Imputation
- Why Not to Use Zero Imputation? Correcting Sparsity Bias in Training Neural Networks
- Instructions and Guide for Diagnostic Questions: The NeurIPS 2020 Education Challenge
- Incomplete Graph Representation and Learning via Partial Graph Neural Networks
- Synthetic Observational Health Data with GANs: from slow adoption to a boom in medical research and ultimately digital twins?
- Linear predictor on linearly-generated data with missing values: non consistency and solutions
- A Comparative Study of Imputation Methods for Multivariate Ordinal Data
- Categorical EHR Imputation with Generative Adversarial Nets
- Are deep learning models superior for missing data imputation in large surveys? Evidence from an empirical comparison
- On the Unreasonable Effectiveness of Feature propagation in Learning on Graphs with Missing Node Features
- Conservative Policy Construction Using Variational Autoencoders for Logged Data with Missing Values
- Astroinformatics based search for globular clusters in the Fornax Deep Survey
- Flow Models for Arbitrary Conditional Likelihoods
- Evaluation of Point Pattern Features for Anomaly Detection of Defect within Random Finite Set Framework
- Unsupervised Data Imputation via Variational Inference of Deep Subspaces
- Robust Multi-Output Learning with Highly Incomplete Data via Restricted Boltzmann Machines
- In-Database Data Imputation
- Causal Discovery from Incomplete Data using An Encoder and Reinforcement Learning
- Generative Adversarial Classification Network with Application to Network Traffic Classification
- Training Generative Adversarial Networks from Incomplete Observations using Factorised Discriminators
- MisConv: Convolutional Neural Networks for Missing Data
- Gradient Importance Learning for Incomplete Observations
- Learning Disentangled Representations of Video with Missing Data
- Blur, Noise, and Compression Robust Generative Adversarial Networks
- Missing Data Imputation for Galaxy Redshift Estimation
- Multiple Organ Failure Prediction with Classifier-Guided Generative Adversarial Imputation Networks
- Variational Auto-Decoder: A Method for Neural Generative Modeling from Incomplete Data
- Causal Inference in medicine and in health policy, a summary
- Networked Time Series Prediction with Incomplete Data via Generative Adversarial Network
- Projected Latent Markov Chain Monte Carlo: Conditional Sampling of Normalizing Flows
- Naive imputation implicitly regularizes high-dimensional linear models
- Tomographic Auto-Encoder: Unsupervised Bayesian Recovery of Corrupted Data
- Deep Multi-path Network Integrating Incomplete Biomarker and Chest CT Data for Evaluating Lung Cancer Risk
- Medical data wrangling with sequential variational autoencoders
- EMFlow: Data Imputation in Latent Space via EM and Deep Flow Models
- Missingness Augmentation: A General Approach for Improving Generative Imputation Models
- Using Shapley Values and Variational Autoencoders to Explain Predictive Models with Dependent Mixed Features
- Variational Gibbs Inference for Statistical Model Estimation from Incomplete Data
- Lung Cancer Risk Estimation with Incomplete Data: A Joint Missing Imputation Perspective
- Multiple Imputation for Biomedical Data using Monte Carlo Dropout Autoencoders
- Domain Adaptation with Incomplete Target Domains