1 paper
Tejaram Sangadi, L. A. Prashanth, Krishna Jagannathan
Motivated by applications in risk-sensitive reinforcement learning, we study mean-variance optimization in a discounted reward Markov Decision Process (MDP). Specifically, we analy…