2 papers
cs.CL2024
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
Shangqing Tu, Zhuoran Pan, Wenxuan Wang +6
Large language models (LLMs) have been increasingly applied to various domains, which triggers increasing concerns about LLMs' safety on specialized domains, e.g. medicine. Despite…
cs.CL2023
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
Shangqing Tu, Yuliang Sun, Yushi Bai +3
To mitigate the potential misuse of large language models (LLMs), recent research has developed watermarking algorithms, which restrict the generation process to leave an invisible…