1 paper · 1 filter
Jaehui Hwang, Sangdoo Yun, Byeongho Heo +1
Large language models (LLMs) are often post-trained on pre-collected reasoning trajectories to improve their reasoning capability. Such trajectories tend to be long due to complex,…