1 paper · 1 filter
Jesson Wang, Zhanhao Hu, David Wagner
Large Language Models (LLMs) are trained with safety alignment to prevent generating malicious content. Although some attacks have highlighted vulnerabilities in these safety-align…