1 paper · 1 filter
Divit Rawal, Michael R. DeWeese
In deep networks with small initialization, training exhibits long plateaus separated by sharp feature-acquisition transitions. Whereas shallow nonlinear networks and deep linear n…