1 paper
David Pfau, Ian Davies, Diana Borsa +3
We introduce Wasserstein Policy Optimization (WPO), an actor-critic algorithm for reinforcement learning in continuous action spaces. WPO can be derived as an approximation to Wass…