1 paper
Junghyun Lee, Branislav Kveton, Anup Rao +4
Large language models (LLMs) solve reasoning problems by first generating a rationale and then answering. We formalize reasoning as a latent variable model and derive a reward-base…