1 paper · 1 filter
Wenhao Chen, Sirui Sun, Shengyuan Bai +1
Aligning large language models (LLMs) with human values typically relies on post-training or inference-time steering that directly manipulates the backbone's parameters or represen…