3 papers
cs.CL2024
Taxi1500: A Multilingual Dataset for Text Classification in 1500 Languages
Chunlan Ma, Ayyoob ImaniGooghari, Haotian Ye +3
While natural language processing tools have been developed extensively for some of the world's languages, a significant portion of the world's over 7000 languages are still neglec…
cs.CL2024
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
Yihong Liu, Chunlan Ma, Haotian Ye +1
The world's more than 7000 languages are written in at least 293 scripts. Due to various reasons, many closely related languages use different scripts, which poses a difficulty for…
cs.CL2024
MoSECroT: Model Stitching with Static Word Embeddings for Crosslingual Zero-shot Transfer
Haotian Ye, Yihong Liu, Chunlan Ma +1
Transformer-based pre-trained language models (PLMs) have achieved remarkable performance in various natural language processing (NLP) tasks. However, pre-training such models can…