1 paper · 1 filter
Guochen Yan, Luyuan Xie, Qingni Shen +2
The current paradigm of training large language models (LLMs) on public available Web data is becoming unsustainable as high-quality data sources in specialized domains near exhaus…