1 paper
Purva Chiniya, Kevin Scaria, Sagar Chaturvedi
Large language models (LLMs) remain susceptible to jailbreak and direct prompt-injection attacks, yet the strongest defensive filters frequently over-refuse benign queries and degr…