1 paper · 1 filter
Jiawei Huang, Qingping Yang, Renjie Zheng +1
Despite recent progress in Large Language Model (LLM) Agents for Software Engineering (SWE) tasks, end-to-end fine-tuning typically relies on verifiable terminal rewards such as wh…