1 paper
Qijun Li, Zheng Fu, Qi Song +4
In complex continuous-control reinforcement learning tasks, multimodal optimal actions often coincide with uncertain, multimodal return distributions, making reliable value estimat…