23 citations · 43 across the 6 of their papers we have counts for
3 papers · 1 filter
Trust-Region-Free Policy Optimization for Stochastic Policies
Mingfei Sun, Benjamin Ellis, Anuj Mahajan +3
Trust Region Policy Optimization (TRPO) is an iterative method that simultaneously maximizes a surrogate objective and enforces a trust region constraint over consecutive policies…
Contrastive Meta-Learning for Partially Observable Few-Shot Learning
Adam Jelley, Amos Storkey, Antreas Antoniou +1
Many contrastive and meta-learning approaches learn representations by identifying common features in multiple views. However, the formalism for these approaches generally assumes…
Deterministic and Discriminative Imitation (D2-Imitation): Revisiting Adversarial Imitation for Sample Efficiency
Mingfei Sun, Sam Devlin, Katja Hofmann +1
Sample efficiency is crucial for imitation learning methods to be applicable in real-world applications. Many studies improve sample efficiency by extending adversarial imitation t…