3 papers
cs.CL2026
Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
Ruan Visser, Trienko Grobler, Marcel Dunaiski
Subword regularization methods such as BPE dropout are typically applied only during fine-tuning, while pretraining is usually done with deterministic tokenization. This creates a…
cs.CL2025
Combining Language and Topic Models for Hierarchical Text Classification
Jaco du Toit, Marcel Dunaiski
Hierarchical text classification (HTC) is a natural language processing task which has the objective of categorising text documents into a set of classes from a predefined structur…
cs.IR2024
Introducing Three New Benchmark Datasets for Hierarchical Text Classification
Jaco du Toit, Herman Redelinghuys, Marcel Dunaiski
Hierarchical Text Classification (HTC) is a natural language processing task with the objective to classify text documents into a set of classes from a structured class hierarchy.…