1 paper
Anirudh Satheesh, Pankaj Kumar Barman, Washim Uddin Mondal +1
We study infinite-horizon Constrained Markov Decision Processes (CMDPs) with general policy parameterizations and multi-layer neural network critics. Existing theoretical analyses…