2 papers
cs.CV2024
Consistency Purification: Effective and Efficient Diffusion Purification towards Certified Robustness
Yiquan Li, Zhongzhu Chen, Kun Jin +3
Diffusion Purification, purifying noised images with diffusion models, has been widely used for enhancing certified robustness via randomized smoothing. However, existing framework…
cs.CR2024
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
Jiongxiao Wang, Jiazhao Li, Yiquan Li +7
Despite the general capabilities of Large Language Models (LLM), these models still request fine-tuning or adaptation with customized data when meeting specific business demands. H…