1 paper
Luyang Zhang, Jingyan Li
Best-of-N inference scaling (drawing N candidate answers from a language model and returning the one a reward model ranks highest) improves accuracy by an amount that varies ac…