most citedImitating Human Behaviour with Diffusion Models

23 citations · 23 across the 2 of their papers we have counts for

collaborators

5 papers

cs.AI202323 cited

Imitating Human Behaviour with Diffusion Models

Tim Pearce, Tabish Rashid, Anssi Kanervisto +8

Diffusion models have emerged as powerful generative models in the text-to-image domain. This paper studies their application as observation-to-action models for imitating human be…

cs.LG20231 cited

Trust-Region-Free Policy Optimization for Stochastic Policies

Mingfei Sun, Benjamin Ellis, Anuj Mahajan +3

Trust Region Policy Optimization (TRPO) is an iterative method that simultaneously maximizes a surrogate objective and enforces a trust region constraint over consecutive policies…

cs.LG2023

Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning

Haoxuan Pan, Deheng Ye, Xiaoming Duan +4

We revisit the estimation bias in policy gradients for the discounted episodic Markov decision process (MDP) from Deep Reinforcement Learning (DRL) perspective. The objective is fo…

cs.LG2023

Sample Dropout: A Simple yet Effective Variance Reduction Technique in Deep Policy Optimization

Zichuan Lin, Xiapeng Wu, Mingfei Sun +4

Recent success in Deep Reinforcement Learning (DRL) methods has shown that policy optimization with respect to an off-policy distribution via importance sampling is effective for s…

cs.LG2021

Deterministic and Discriminative Imitation (D2-Imitation): Revisiting Adversarial Imitation for Sample Efficiency

Mingfei Sun, Sam Devlin, Katja Hofmann +1

Sample efficiency is crucial for imitation learning methods to be applicable in real-world applications. Many studies improve sample efficiency by extending adversarial imitation t…