1 paper
Jaehui Hwang, Sangdoo Yun, Byeongho Heo +1
Large language models (LLMs) are often post-trained on pre-collected reasoning trajectories to improve their reasoning capability. Such trajectories tend to be long due to complex,…