Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
Jiahui Peng, Xinlin Zhuang, Jiantao Qiu +4
The performance of large language models (LLMs) is significantly affected by the quality and composition of their pre-training data, which is inherently diverse, spanning various l…
cs.CL2025
WanJuanSiLu: A High-Quality Open-Source Webtext Dataset for Low-Resource Languages
Jia Yu, Fei Yuan, Rui Min +20
This paper introduces the open-source dataset WanJuanSiLu, designed to provide high-quality training corpora for low-resource languages, thereby advancing the research and developm…