1 paper
Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav +4
Defending LLMs against adversarial jailbreak attacks remains an open challenge. Existing defenses rely on binary classifiers that fail when adversarial input falls outside the lear…