1 paper
Qi Wang, Chengcheng Wan, Jiangtao Wang
Large language models (LLMs) are increasingly deployed in safety-critical applications, yet jailbreak attacks can conceal harmful intent through role-playing, fictional scenarios,…