1 paper
Mingye Zhu, Yi Liu, Zheren Fu +2
Training Large Language Models (LLMs) for chain-of-thought reasoning presents a significant challenge: supervised fine-tuning on a single "golden" rationale hurts generalization as…