1 paper · 1 filter
Hsiang Hsu, Eric Lei, Chun-Fu Chen
Inference-time alignment effectively steers large language models (LLMs) by generating multiple candidates from a reference model and selecting among them with an imperfect reward…