1 paper · 1 filter
Yang Liu, Jeremy Bernstein, Markus Meister +1
Descent methods for deep networks are notoriously capricious: they require careful tuning of step size, momentum and weight decay, and which method will work best on a new benchmar…