1 paper · 1 filter
Anil Kamber, Rahul Parhi
Weight decay is ubiquitous in training deep neural network architectures. Its empirical success is often attributed to capacity control; nonetheless, our theoretical understanding…