1 paper
Tuan T. Nguyen, John Le, Thai T. Vu +2
Large language models (LLMs) achieve impressive performance across diverse tasks yet remain vulnerable to jailbreak attacks that bypass safety mechanisms. We present RAID (Refusal-…