2 papers
cs.CL2025
The Token Tax: Systematic Bias in Multilingual Tokenization
Jessica M. Lundin, Ada Zhang, Nihal Karim +4
Tokenization inefficiency imposes structural disadvantages on morphologically complex, low-resource languages, inflating compute resources and depressing accuracy. We evaluate 10 l…
cs.LG2025
Exploiting Student Parallelism for Efficient GPU Inference of BERT-like Models in Online Services
Weiyan Wang, Yilun Jin, Yiming Zhang +7
Due to high accuracy, BERT-like models have been widely adopted by text mining and web searching. However, large BERT-like models suffer from inefficient online inference, facing t…