1 paper · 1 filter
Jingtan Wang, Arun Verma, Xiaoqiang Lin +4
How to divide a fixed annotation budget between supervised fine-tuning (SFT) and reinforcement learning (RL) during LLM post-training remains an open problem. Existing work charact…