1 paper · 1 filter
Patrick Cooper, Alireza Nadali, Ashutosh Trivedi +1
Large language models (LLMs) are known to exhibit brittle behavior under adversarial prompts and jailbreak attacks, even after extensive alignment and fine-tuning. This fragility r…