1 paper · 1 filter
Zhuoran Yang, Yanyong Zhang
Large Language Models (LLMs) face threats from jailbreak prompts. Existing methods for defending against jailbreak attacks are primarily based on auxiliary models. These strategies…