1 paper
Jinkun Chen, Fengxiang Cheng, Sijia Han +1
Reasoning failures in large language models (LLMs) are typically measured only at the end of a generation, yet many failures manifest as a process-level breakdown: the model "loses…