1 paper · 1 filter
Hayder Elesedy, Pedro M. Esperança, Silviu Vlad Oprea +1
Guardrails have emerged as an alternative to safety alignment for content moderation of large language models (LLMs). Existing model-based guardrails have not been designed for res…