1 paper · 1 filter
Zheng Wang, Muchen Li, Renjie Liao +1
Steering aligns large language models (LLMs) by injecting a bias into selected activations at inference time, offering a far cheaper alternative to weight-update methods such as su…