1 paper · 1 filter
Zhenhong Zhou, Haiyang Yu, Xinghua Zhang +6
Large language models (LLMs) achieve state-of-the-art performance on multiple language tasks, yet their safety guardrails can be circumvented, leading to harmful generations. In li…