1 paper · 1 filter
Prithviraj Singh Shahani, Kaveh Eskandari Miandoab, Matthias Scheutz
Safety guardrails in large language models (LLMs) are a critical component in preventing harmful outputs. Yet, their resilience under perturbation remains poorly understood. In thi…