1 paper
Alec K. Peltekian, Halil Ertugrul Aktas, Gorkem Durak +10
Mixture-of-Experts (MoE) architectures achieve scalable learning by routing inputs to specialized subnetworks through conditional computation. However, conventional MoE designs ass…