1 paper
Zhitao Zhu, Xili Wang, Shizhe Wu +2
High-quality data is scarce in large language model (LLM) training, yet how to schedule its use with optimization dynamics lacks theoretical guidance. We extend functional scaling…