1 paper
Weidong Huang, Zhehan Li, Hangxin Liu +3
Reinforcement learning (RL) is widely used for humanoid control, with on-policy methods such as Proximal Policy Optimization (PPO) enabling robust training via large-scale parallel…