1 paper
Yuqing Zhou, Hong Wang, Manqing Mao +8
Large reasoning models can produce correct yet unnecessarily long reasoning traces. Existing methods improve reasoning efficiency with trajectory-level objectives or local token- a…