1 paper
Zhenya Liu, Yang Meng, Zhuokai Zhao +2
When a single policy is trained in parallel across multiple environments of the same task, such as procedurally generated levels, randomized dynamics, or curricula, implementations…