1 paper
Zikai Zhang, Rui Hu, Olivera Kotevska +1
Large Language Models (LLMs) are powerful tools for answering user queries, yet they remain highly vulnerable to jailbreak attacks. Existing guardrail methods typically rely on int…