1 paper
Daniel Kuznetsov, Ofir Cohen, Karin Shistik +2
Safety-aligned LLMs go through refusal training to reject harmful requests, but whether these mechanisms remain effective under emotionally charged stimuli is unexplored. We introd…