1 paper
Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar +11
Reinforcement learning typically optimizes average reward. For generative policies, the average can hide an important distinction: two policies can achieve the same mean reward whi…