1 paper · 1 filter
Wenbo Pan, Zhichao Liu, Qiguang Chen +3
Large Language Models' safety-aligned behaviors, such as refusing harmful queries, can be represented by linear directions in activation space. Previous research modeled safety beh…