1 paper · 1 filter
Marcel Tomàs Bernal, Neil Rohit Mallinar, Mikhail Belkin
Grokking occurs when a model achieves high training accuracy but generalization to unseen test points happens long after that. This phenomenon was initially observed on a class of…