1 paper
Kai Xu, Farid Tajaddodianfar, Ben Allison
Recently proposed reward-conditioned policies (RCPs) offer an appealing alternative in reinforcement learning. Compared with policy gradient methods, policy learning in RCPs is sim…