#temporal-difference learning
topictemporal-difference learning
2 papers · 1 filter
cs.LG2026
Reinforcement Learning in Switching Non-Stationary Markov Decision Processes: Algorithms and Convergence Analysis
Mohsen Amiri, Sindri Magnússon
The paper introduces a Switching Non-Stationary MDP framework where the environment alternates among a finite set of MDPs via a hidden Markov chain, and proves that standard TD lea…
cs.LG2026
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
Leitian Tao, Baolin Peng, Wenlin Yao +5
The paper proposes TRACE, a turn-level reward assignment method that estimates credit for each tool-call in long-horizon agents using log‑ratio state values and temporal‑difference…