1 paper · 1 filter
Eric Lei, Hsiang Hsu, Chun-Fu Chen
Inference-time alignment methods, such as Best-of-N, offer a flexible alternative to training-based alignment by using reward models to select high-quality responses generated by…