1 paper · 1 filter
Yuting Tan, Xuying Li, Zhuo Li +2
Gradient-based adversarial prompting, such as the Greedy Coordinate Gradient (GCG) algorithm, has emerged as a powerful method for jailbreaking large language models (LLMs). In thi…