1 paper
Woojin Chung, Jiwoo Hong, Na Min An +2
Stable pre-training is essential for achieving better-performing language models. However, tracking pre-training stability by calculating gradient variance at every step is impract…