2 papers
cs.DC2026
Cobalt: Leveraging Expert Co-activation for Efficient Distributed MoE Training
Junkang Zhou, Xinyi Liu, Fangcheng Fu
Mixture-of-Experts (MoE) has increasingly become a mainstream approach for scaling large language models, as it expands model capacity while keeping computation cost nearly constan…
cs.LG2026
Unifying Distributional Training for One-Step Visual Generation
Chi Zhang, Shi Haoyang, Haoyang Shi +10
Distributional training provides collective supervision for one-step visual generation by matching real and generated features in frozen representation spaces. We introduce a unifi…