1 paper
Brett Daley, Martha White, Christopher Amato +1
Off-policy learning from multistep returns is crucial for sample-efficient reinforcement learning, but counteracting off-policy bias without exacerbating variance is challenging. C…