1 paper · 1 filter
Tongzhou Mu, Minghua Liu, Hao Su
The success of many RL techniques heavily relies on human-engineered dense rewards, which typically demand substantial domain expertise and extensive trial and error. In our work,…