1 paper · 1 filter
Marc Höftmann, Jan Robine, Stefan Harmeling
In reinforcement learning, critics typically estimate absolute state values V(s), estimating how good a particular situation is in isolation. However, it turns out that only diff…