Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
Xin Yi, Shunfan Zheng, Linlin Wang +3
The emergence of finetuning-as-a-service has revealed a new vulnerability in large language models (LLMs). A mere handful of malicious data uploaded by users can subtly manipulate…
cs.CL2024
Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
Xin Yi, Linlin Wang, Xiaoling Wang +1
Impressive results have been achieved in natural language processing (NLP) tasks through the training of large language models (LLMs). However, these models occasionally produce to…