1 paper · 1 filter
Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik
Most safety guardrails for large language models (LLMs) evaluate each prompt-response pair in isolation, which misses failures that arise only over a dialogue as benign turns compo…