1 paper
Zizhao Chen, Yuying Li, Siting Lin +1
Although large language models rely on chain-of-thought for complex reasoning, the overthinking phenomenon severely degrades inference efficiency. Existing reinforcement learning m…