17 citations · 34 across the 27 of their papers we have counts for
1 paper · 1 filter
Xiaorui Wu, Fei Li, Xiaofeng Mao +6
Large language models (LLMs) frequently refuse to respond to pseudo-malicious instructions: semantically harmless input queries triggering unnecessary LLM refusals due to conservat…