1 paper
Ruan Visser, Trienko Grobler, Marcel Dunaiski
Subword regularization methods such as BPE dropout are typically applied only during fine-tuning, while pretraining is usually done with deterministic tokenization. This creates a…