Data Augmentation for Low-Resource Neural Machine Translation
arXiv:1705.00440 · doi:10.18653/v1/P17-2090
Abstract
The quality of a Neural Machine Translation system depends substantially on the availability of sizable parallel corpora. For low-resource language pairs this is not the case, resulting in poor translation quality. Inspired by work in computer vision, we propose a novel data augmentation approach that targets low-frequency words by generating new sentence pairs containing rare words in new, synthetically created contexts. Experimental results on simulated low-resource settings show that our method improves translation quality by up to 2.9 BLEU points over the baseline and up to 3.2 BLEU over back-translation.
5 pages, 2 figures, Accepted at ACL 2017
Cited by in corpus (14)
- A Survey on Data Augmentation for Text Classification
- Data Augmentation in Natural Language Processing: A Novel Text Generation Approach for Long and Short Text Classifiers
- Query Resolution for Conversational Search with Limited Supervision
- Synthetic Datasets for Autonomous Driving: A Survey
- Improving short text classification through global augmentation methods
- Snippext: Semi-supervised Opinion Mining with Augmented Data
- Universal Multimodal Representation for Language Understanding
- A Survey of Orthographic Information in Machine Translation
- Misogynistic Tweet Detection: Modelling CNN with Small Datasets
- Overlapping Word Removal is All You Need: Revisiting Data Imbalance in Hope Speech Detection
- Non-Fluent Synthetic Target-Language Data Improve Neural Machine Translation
- Backtranslation and paraphrasing in the LLM era? Comparing data augmentation methods for emotion classification
- Optimizing Deep Transformers for Chinese-Thai Low-Resource Translation
- Restoring Rhythm: Punctuation Restoration Using Transformer Models for Bangla, A Low-Resource Language