1 paper · 1 filter
Lianhai Ren, Yucheng Ding, Xiao Liu +2
Training instability remains a critical challenge in large language model (LLM) pretraining, often manifesting as sudden gradient explosions that waste significant computational re…