1 paper
Piotr Kozakowski, Łukasz Kaiser, Henryk Michalewski +2
Sample efficiency and performance in the offline setting have emerged as significant challenges of deep reinforcement learning. We introduce Q-Value Weighted Regression (QWR), a si…