1 paper
Weijiang Lv, Wentong Zhao, Jiayu Wang +3
Chain-of-Thought (CoT) reasoning has advanced large language models (LLMs), but outcome-based supervision leads to pervasive post-hoc rationalization, producing plausible yet unfai…