1 paper
Weize Liu, Yongchi Zhao, Yijia Luo +8
Large language models (LLMs) perform strongly on many language tasks but still struggle with complex multi-step reasoning across disciplines. Existing reasoning datasets often lack…