1 paper
Yuhang Liu, Heyan Huang, Yizhe Yang +3
Large language models (LLMs) have achieved strong performance on reasoning benchmarks, yet their ability to solve real-world problems requiring end-to-end workflows remains unclear…