1 paper
Zhenyu Han, Ansheng You, Haibo Wang +16
Reinforcement learning (RL) has become a pivotal technology in the post-training phase of large language models (LLMs). Traditional task-colocated RL frameworks suffer from signifi…