1 paper
Ming Dong, Shiyi Tang, Ziyan Peng +2
Knowledge-Editing-based (KE-based) detoxification has emerged as a promising approach for mitigating harmful behaviours in Large Language Models. Existing evaluations, however, lar…