1 paper
Chenghao Li, Xiao Han, Xinxin Huang +22
The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion…