2 papers
cs.LG2026
Stabilizing Transformer Training Through Consensus
Shyam Venkatasubramanian, Sean Moushegian, Michael Lin +3
Standard attention-based transformers are known to exhibit instability under learning rate overspecification during training, particularly at high learning rates. While various met…
cs.LG2025
FSL-SAGE: Accelerating Federated Split Learning via Smashed Activation Gradient Estimation
Srijith Nair, Michael Lin, Peizhong Ju +3
Collaborative training methods like Federated Learning (FL) and Split Learning (SL) enable distributed machine learning without sharing raw data. However, FL assumes clients can tr…