1 paper
Rahul Markasserithodi, Aditya Joshi, Yuekang Li +3
Despite advances in safety alignment, prompt-rewriting attacks such as persona modulation, fictional framing and persuasion-based reformulation, can bypass safety filters even on f…