1 paper · 1 filter
Haozheng Luo, Jiahao Yu, Wenxin Zhang +9
We introduce a training-free safety enhancement method for aligning large language models (LLMs) without the need for supervised fine-tuning or reinforcement learning from human fe…