1 paper
Prayas Agrawal, Prateek Chanda, Ishita Khatri +3
Training large language models (LLMs) on heterogeneous data requires selecting minibatches that balance convergence speed with coverage across domains. Existing methods either sele…