1 paper · 1 filter
Sheng Liu, Qiang Sheng, Danding Wang +3
Despite advances in improving large language model (LLM) to refuse to answer malicious instructions, widely used LLMs remain vulnerable to jailbreak attacks where attackers generat…