1 paper
Kirill Labzin, Stepan Kulibaba, Artem Dzhalilov +1
Sparse mixture-of-experts (MoE) models use an independently parameterized router at each sparse layer to select experts for every token. Prior work has shown that routing decisions…