1 paper
Shyam Venkatasubramanian, Sean Moushegian, Michael Lin +3
Standard attention-based transformers are known to exhibit instability under learning rate overspecification during training, particularly at high learning rates. While various met…