1 paper
Tongtong Liang, Esha Singh, Rahul Parhi +2
Gradient descent on overparameterized neural networks typically operates at the Edge of Stability (EoS), where the largest Hessian eigenvalue hovers around a step-size-dependent th…