1 paper
Jingxuan Xu, Gang Wu, Yanan Wu +13
While test-time scaling enhances Large Language Model (LLM) agents in long-horizon software engineering (SWE), sparse binary rewards (Pass/Fail) create a severe credit assignment c…