#dense rewards
topicdense rewards
3 papers · 1 filter
cs.LG2026
DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning
Shuhang Wang, Ziming Li, Hui Cheng
The paper introduces DHRCL, a reinforcement‑learning framework for code‑focused large language models that uses a hierarchy of dense rewards (syntax, execution, unit‑test pass, and…
cs.LG2026
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
Leitian Tao, Baolin Peng, Wenlin Yao +5
The paper proposes TRACE, a turn-level reward assignment method that estimates credit for each tool-call in long-horizon agents using log‑ratio state values and temporal‑difference…
cs.AI2026
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Zongxia Li, Zhongzhi Li, Yucheng Shi +10
The paper presents Long-Horizon-Terminal-Bench, a benchmark of 46 extended tasks with fine-grained intermediate rewards to evaluate AI agents' long-horizon planning and debugging a…