1 paper
Lingzhe Zhang, Tong Jia, Yunpeng Zhai +6
Reinforcement fine-tuning (RFT) has become a core paradigm for post-training large language models, yet its training process remains highly fragile. Existing efforts mainly improve…