1 paper
Yaning Jia, Chunhui Zhang, Wenxuan Xu +3
Supervised fine-tuning (SFT) applies a uniform cross-entropy loss to all target tokens, even though different tokens provide unequal learning signals for mathematical reasoning. Th…