Charagram: Embedding Words and Sentences via Character n-grams
arXiv:1607.02789
Abstract
We present Charagram embeddings, a simple approach for learning character-based compositional models to embed textual sequences. A word or sentence is represented using a character n-gram count vector, followed by a single nonlinear transformation to yield a low-dimensional embedding. We use three tasks for evaluation: word similarity, sentence similarity, and part-of-speech tagging. We demonstrate that Charagram embeddings outperform more complex architectures based on character-level recurrent and convolutional neural networks, achieving new state-of-the-art performance on several similarity tasks.
References in corpus (2)
Cited by in corpus (7)
- Semantic Specialisation of Distributional Word Vector Spaces using Monolingual and Cross-Lingual Constraints
- Chinese Embedding via Stroke and Glyph Information: A Dual-channel View
- Terminology-based Text Embedding for Computing Document Similarities on Technical Content
- VCWE: Visual Character-Enhanced Word Embeddings
- Automated Word Stress Detection in Russian
- Improving Distributed Representations of Tweets - Present and Future
- Patterns versus Characters in Subword-aware Neural Language Modeling