1 paper
Wenhao Chen, Sirui Sun, Shengyuan Bai +1
Aligning large language models (LLMs) with human values typically relies on post-training or inference-time steering that directly manipulates the backbone's parameters or represen…