1 paper · 1 filter
Yuxiao Lu, Lin Xu, Yang Sun +2
Large language models (LLMs) aligned for safety often suffer from over-refusal, the tendency to reject seemingly toxic or benign prompts by misclassifying them as toxic. This behav…