1 paper
Harry Mead, Clarissa Costen, Bruno Lacerda +1
When optimising for conditional value at risk (CVaR) using policy gradients (PG), current methods rely on discarding a large proportion of trajectories, resulting in poor sample ef…