1 paper
Fengjuan Wang, Zhiyi Su, Xingzhu Hu +2
Training large Mixture-of-Experts (MoE) models remains computationally prohibitive due to their extreme compute and memory demands. Although low-precision training promises to acce…