1 paper
Ping Wang, Yan-Qi Du
We introduce a finite-size gradient-transport framework for real language-model training, based on five observables (D,z,I^2,I^´,vrel) that separate cascade size, durat…