1 paper · 1 filter
Jingyuan Yang, Bowen Yan, Rongjun Li +4
Unsafe prompts pose significant safety risks to large language models (LLMs). Existing methods for detecting unsafe prompts rely on data-driven fine-tuning to train guardrail model…