1 paper
Kuan-Lin Chu, Chung-En Sun, Tsui-Wei Weng
Despite extensive alignment efforts, Large Language Models (LLMs) remain vulnerable to generating unsafe content under adversarial prompting, yet the internal mechanisms by which s…