Explaining and Harnessing Adversarial Examples
arXiv:1412.6572
Abstract
Several machine learning models, including neural networks, consistently misclassify adversarial examples---inputs formed by applying small but intentionally worst-case perturbations to examples from the dataset, such that the perturbed input results in the model outputting an incorrect answer with high confidence. Early attempts at explaining this phenomenon focused on nonlinearity and overfitting. We argue instead that the primary cause of neural networks' vulnerability to adversarial perturbation is their linear nature. This explanation is supported by new quantitative results while giving the first explanation of the most intriguing fact about them: their generalization across architectures and training sets. Moreover, this view yields a simple and fast method of generating adversarial examples. Using this approach to provide examples for adversarial training, we reduce the test set error of a maxout network on the MNIST dataset.
References in corpus (3)
Cited by in corpus (80)
- ZOO: Zeroth Order Optimization based Black-box Attacks to Deep Neural Networks without Training Substitute Models
- On Evaluating Adversarial Robustness
- Towards Principled Methods for Training Generative Adversarial Networks
- Deep and Confident Prediction for Time Series at Uber
- A Closer Look at Memorization in Deep Networks
- TextBugger: Generating Adversarial Text Against Real-world Applications
- A study of the effect of JPG compression on adversarial images
- Qualitatively characterizing neural network optimization problems
- Direct Feedback Alignment Provides Learning in Deep Neural Networks
- Spectrally-normalized margin bounds for neural networks
- Towards Crafting Text Adversarial Samples
- Evaluating the Robustness of Neural Networks: An Extreme Value Theory Approach
- advertorch v0.1: An Adversarial Robustness Toolbox based on PyTorch
- A Boundary Tilting Persepective on the Phenomenon of Adversarial Examples
- Adversarial Examples, Uncertainty, and Transfer Testing Robustness in Gaussian Process Hybrid Deep Networks
- Learning to Protect Communications with Adversarial Neural Cryptography
- AI Safety Gridworlds
- Dropout Inference in Bayesian Neural Networks with Alpha-divergences
- Fast Feature Fool: A data independent approach to universal adversarial perturbations
- Universal adversarial perturbations
- Towards Interpretable Deep Neural Networks by Leveraging Adversarial Examples
- Assuring the Machine Learning Lifecycle: Desiderata, Methods, and Challenges
- Optimization and Abstraction: A Synergistic Approach for Analyzing Neural Network Robustness
- Photographic Image Synthesis with Cascaded Refinement Networks
- A Simple Explanation for the Existence of Adversarial Examples with Small Hamming Distance
- The Limitations of Adversarial Training and the Blind-Spot Attack
- On Lightweight Privacy-Preserving Collaborative Learning for IoT Objects
- Characterizing and evaluating adversarial examples for Offline Handwritten Signature Verification
- Unsupervised Histopathology Image Synthesis
- Discretization based Solutions for Secure Machine Learning against Adversarial Attacks
- Noise Flooding for Detecting Audio Adversarial Examples Against Automatic Speech Recognition
- Concise Fuzzy System Modeling Integrating Soft Subspace Clustering and Sparse Learning
- Evading Defenses to Transferable Adversarial Examples by Translation-Invariant Attacks
- VC Classes are Adversarially Robustly Learnable, but Only Improperly
- A deep architecture for unified aesthetic prediction
- DeepBillboard: Systematic Physical-World Testing of Autonomous Driving Systems
- Adversarial Machine Learning And Speech Emotion Recognition: Utilizing Generative Adversarial Networks For Robustness
- Local minima in training of neural networks
- On the Robustness of Convolutional Neural Networks to Internal Architecture and Weight Perturbations
- Defensive Quantization: When Efficiency Meets Robustness
- Quality Resilient Deep Neural Networks
- Quantifying Perceptual Distortion of Adversarial Examples
- Adversarial Phenomenon in the Eyes of Bayesian Deep Learning
- Explaining Vulnerabilities of Deep Learning to Adversarial Malware Binaries
- DANCin SEQ2SEQ: Fooling Text Classifiers with Adversarial Text Example Generation
- Fooling a Real Car with Adversarial Traffic Signs
- Towards Imperceptible and Robust Adversarial Example Attacks against Neural Networks
- Provable Certificates for Adversarial Examples: Fitting a Ball in the Union of Polytopes
- Enhancing the Robustness of Deep Neural Networks by Boundary Conditional GAN
- Metamorphic Detection of Adversarial Examples in Deep Learning Models With Affine Transformations
- Should Adversarial Attacks Use Pixel p-Norm?
- Temporal-Clustering Invariance in Irregular Healthcare Time Series
- Attention Allocation Aid for Visual Search
- Universal Lipschitz Approximation in Bounded Depth Neural Networks
- Geometric robustness of deep networks: analysis and improvement
- Adversarial Security Attacks and Perturbations on Machine Learning and Deep Learning Methods
- "I know it when I see it". Visualization and Intuitive Interpretability
- Trust but Verify: An Information-Theoretic Explanation for the Adversarial Fragility of Machine Learning Systems, and a General Defense against Adversarial Attacks
- Virtual Adversarial Ladder Networks For Semi-supervised Learning
- Analytical Moment Regularizer for Gaussian Robust Networks
- Generative adversarial network based on chaotic time series
- Designing Adversarially Resilient Classifiers using Resilient Feature Engineering
- Adequacy of the Gradient-Descent Method for Classifier Evasion Attacks
- Representation of White- and Black-Box Adversarial Examples in Deep Neural Networks and Humans: A Functional Magnetic Resonance Imaging Study
- Kernelized Capsule Networks
- Latent Adversarial Defence with Boundary-guided Generation
- Out-of-Sample Testing for GANs
- An Information-Theoretic Explanation for the Adversarial Fragility of AI Classifiers
- Sentiment Tagging with Partial Labels using Modular Architectures
- Augmenting Model Robustness with Transformation-Invariant Attacks
- Predicting "Design Gaps" in the Market: Deep Consumer Choice Models under Probabilistic Design Constraints
- Why Blocking Targeted Adversarial Perturbations Impairs the Ability to Learn
- Non-Determinism in Neural Networks for Adversarial Robustness
- Residual Networks as Nonlinear Systems: Stability Analysis using Linearization
- State-Reification Networks: Improving Generalization by Modeling the Distribution of Hidden Representations
- Generating Minimal Adversarial Perturbations with Integrated Adaptive Gradients
- Can Intelligent Hyperparameter Selection Improve Resistance to Adversarial Examples?
- Thwarting finite difference adversarial attacks with output randomization
- Adversarial Perturbation Intensity Achieving Chosen Intra-Technique Transferability Level for Logistic Regression
- Generating Adversarial Perturbation with Root Mean Square Gradient