1 paper · 1 filter
Xiaofeng Lin, Hejian Sang, Zhipeng Wang +1
A prevailing view holds that supervised fine-tuning (SFT) memorizes training data and fails to generalize, whereas reinforcement learning (RL) attains broader robustness. We revisi…