1 paper · 1 filter
Renhao Wang, Kevin Frans, Pieter Abbeel +2
Sample-efficient online reinforcement learning often uses replay buffers to store experience for reuse when updating the value function. However, uniform replay is inefficient, sin…