1 paper · 1 filter
Shubham Kumar, Narendra Ahuja
Safety trained large language models (LLMs) can often be induced to answer harmful requests through jailbreak prompts. Because we lack a robust understanding of why LLMs are suscep…