From the 1 of 6 linked papers with an AI index.
6 papers
Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning
Ankur Naskar, Vivek T A, Aditya Kumar +2
Discounted exponential utility provides a principled criterion for risk-sensitive sequential decision-making, but its nonlinear structure complicates reinforcement learning. A rece…
Hierarchical Multilevel Monte Carlo for Order-Optimal Neural Actor-Critic in Average-Reward CMDPs
Ankur Naskar, Vaneet Aggarwal
The paper proposes a hierarchical Multilevel Monte Carlo neural critic to reduce bias and cost in actor‑critic reinforcement learning for average‑reward constrained Markov decision…
Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL
Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal
Many reinforcement learning (RL) problems in the infinite-horizon average-reward setting require optimizing multiple conflicting objectives while satisfying multiple safety constra…
Reinforcement Learning for Exponential Utility: Algorithms and Convergence in Discounted MDPs
Gugan Thoppe, L. A. Prashanth, Ankur Naskar +1
Reinforcement learning (RL) for exponential-utility optimization in discounted Markov decision processes (MDPs) lacks principled value-based algorithms. We address this gap in the…
Parameter-free Optimal Rates for Nonlinear Semi-Norm Contractions with Applications to -Learning
Ankur Naskar, Gugan Thoppe, Vijay Gupta
Algorithms for solving \textit{nonlinear} fixed-point equations -- such as average-reward \textit{-learning} and \textit{TD-learning} -- often involve semi-norm contractions. Ac…
Parameter-Free Federated TD Learning with Markov Noise in Heterogeneous Environments
Ankur Naskar, Gugan Thoppe, Utsav Negi +1
Federated learning (FL) can dramatically speed up reinforcement learning by distributing exploration and training across multiple agents. It can guarantee an optimal convergence ra…