1 paper
Nick Bettencourt, Xiaowei Ding, Kay Giesecke
As high-quality public web corpora become increasingly exhausted, clean long-context documents have become a scarce and expensive source of training data for large language models…