1 paper · 1 filter
Humphrey Munn, Brendan Tidd, Peter Böhm +2
Reinforcement Learning (RL) robot controllers usually aggregate many task objectives into one scalar reward. While large-scale proximal policy optimisation (PPO) has enabled impres…