2 papers
cs.AI2025
Reimagining Safety Alignment with An Image
Yifan Xia, Guorui Chen, Wenqian Yu +3
Large language models (LLMs) excel in diverse applications but face dual challenges: generating harmful content under jailbreak attacks and over-refusal of benign queries due to ri…
cs.CR2025
LLM Jailbreak Detection for (Almost) Free!
Guorui Chen, Yifan Xia, Xiaojun Jia +3
Large language models (LLMs) enhance security through alignment when widely used, but remain susceptible to jailbreak attacks capable of producing inappropriate content. Jailbreak…