1 paper · 1 filter
Jinkun Chen, Fengxiang Cheng, Sijia Han +1
Reasoning failures in large language models (LLMs) are typically measured only at the end of a generation, yet many failures manifest as a process-level breakdown: the model "loses…