1 paper · 1 filter
Yuelin Hu, Zhenbo Yu, Zhengxue Cheng +2
Hybrid post-training usually combines supervised fine-tuning and reinforcement learning, but fixed mixing schedules cannot adapt when the relative noise of the two signals changes…