1 paper
Ying Zhang, Congyu Qiao, Xin Geng +1
Large Language Models (LLMs) rely on safety alignment to obey safe requests while refusing harmful ones. However, traditional refusal mechanisms often lead to "rigid rejection," wh…