1 paper · 1 filter
Weipeng Jiang, Zhenting Wang, Juan Zhai +3
Despite prior safety alignment efforts, mainstream LLMs can still generate harmful and unethical content when subjected to jailbreaking attacks. Existing jailbreaking methods fall…