1 paper
Shuai Li, Qinglin Wang, Ping Luo +8
Federated Transformer training increasingly relies on local AdamW, whose adaptive updates can provide much stronger local progress than SGD-based training. However, under heterogen…