1 paper
Tianlong Wang, Junzhe Chen, Xueting Han +1
Post-training, particularly reinforcement learning (RL) using self-play-generated data, has become a new learning paradigm for large language models (LLMs). However, scaling RL to…