1 paper
Jundong Zhang, Yuhui Situ, Fanji Zhang +2
Tasks involving high-risk-high-return (HRHR) actions, such as obstacle crossing, often exhibit multimodal action distributions and stochastic returns. Most reinforcement learning (…