Recurrent Neural Network Regularization
arXiv:1409.2329
Abstract
We present a simple regularization technique for Recurrent Neural Networks (RNNs) with Long Short-Term Memory (LSTM) units. Dropout, the most successful technique for regularizing neural networks, does not work well with RNNs and LSTMs. In this paper, we show how to correctly apply dropout to LSTMs, and show that it substantially reduces overfitting on a variety of tasks. These tasks include language modeling, speech recognition, image caption generation, and machine translation.
References in corpus (2)
Cited by in corpus (11)
- Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models
- Scalable Bayesian Optimization Using Deep Neural Networks
- Gated Feedback Recurrent Neural Networks
- Learning Longer Memory in Recurrent Neural Networks
- Qualitatively characterizing neural network optimization problems
- Parallel Multi-Dimensional LSTM, With Application to Fast Biomedical Volumetric Image Segmentation
- Deep Visual-Semantic Alignments for Generating Image Descriptions
- Addressing the Rare Word Problem in Neural Machine Translation
- Efficient batchwise dropout training using submatrices
- Learning Temporal Embeddings for Complex Video Analysis
- Regularizing Recurrent Networks - On Injected Noise and Norm-based Methods