1 paper
Yulong Chen, Qi Zhang, Jiawen Zhang +4
Large Language Models (LLMs) remain vulnerable to jailbreak attacks, where adversarially crafted prompts induce policy-violating responses despite safety alignment. Existing defens…