2 papers
cs.LG2026
Improving Regret Approximation for Unsupervised Dynamic Environment Generation
Harry Mead, Bruno Lacerda, Jakob Foerster +1
Unsupervised Environment Design (UED) seeks to automatically generate training curricula for reinforcement learning (RL) agents, with the goal of improving generalisation and zero-…
cs.LG2025
Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation
Harry Mead, Clarissa Costen, Bruno Lacerda +1
When optimising for conditional value at risk (CVaR) using policy gradients (PG), current methods rely on discarding a large proportion of trajectories, resulting in poor sample ef…