1 paper
Mukesh Ghimire, Aosong Feng, Liwen You +3
Current techniques for post-training Large Language Models (LLMs) rely either on costly human supervision or on external verifiers to boost performance on tasks such as mathematica…