Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024
CAP: Data Contamination Detection via Consistency Amplification
Yi Zhao, Jing Li, Linyi Yang
Large language models (LLMs) are widely used, but concerns about data contamination challenge the reliability of LLM evaluations. Existing contamination detection methods are often…
cs.CL2024
Detoxifying Large Language Models via Knowledge Editing
Mengru Wang, Ningyu Zhang, Ziwen Xu +7
This paper investigates using knowledge editing techniques to detoxify Large Language Models (LLMs). We construct a benchmark, SafeEdit, which covers nine unsafe categories with va…