1 paper
Qihuang Zhong, Liang Ding, Li Shen +4
Fine-tuning large pretrained language models on a limited training corpus usually suffers from poor generalization. Prior works show that the recently-proposed sharpness-aware mini…