1 paper
Xiaorui Wu, Fei Li, Xiaofeng Mao +6
Large language models (LLMs) frequently refuse to respond to pseudo-malicious instructions: semantically harmless input queries triggering unnecessary LLM refusals due to conservat…