1 paper
Jie Hao, Rui Yu, Wei Zhang +3
Effective data selection is essential for pretraining large language models (LLMs), enhancing efficiency and improving generalization to downstream tasks. However, existing approac…