1 paper · 1 filter
Juno Kim, Denny Wu, Jason Lee +1
A key paradigm to improve the reasoning capabilities of large language models (LLMs) is to allocate more inference-time compute to search against a verifier or reward model. This p…