1 paper
Minseo Kwak, Jaehyung Kim
The opacity of massive pretraining corpora in Large Language Models (LLMs) raises significant privacy and copyright concerns, making pretraining data detection a critical challenge…