1 paper · 1 filter
Yifan Xia, Guorui Chen, Wenqian Yu +3
Large language models (LLMs) excel in diverse applications but face dual challenges: generating harmful content under jailbreak attacks and over-refusal of benign queries due to ri…