1 paper
Voot Tangkaratt, Herke van Hoof, Simone Parisi +3
Direct contextual policy search methods learn to improve policy parameters and simultaneously generalize these parameters to different context or task variables. However, learning…