1 paper
Wenhan Chang, Tianqing Zhu, Ping Xiong +2
Reliable refusal behavior requires Large Language Models (LLMs) to reject harmful prompts with only answering benign ones. Incorrect refusal behavior can either expose users to har…