2 papers
cs.DC2026
RoutePack: Expert Placement and Attention-Aware Data Packing for MoE Reinforcement Learning
Yibo Shen, Xudong Han, Xiaowei Zhu +2
Training Mixture-of-Experts (MoE) models for reinforcement learning (RL) couples two load-balancing problems: sequence composition determines dense attention work in each data-para…
cs.LG2026
LLaDA2.1: Speeding Up Text Diffusion via Token Editing
Tiwei Bie, Maosong Cao, Xiang Cao +47
While LLaDA2.0 showcased the scaling potential of 100B-level block-diffusion models and their inherent parallelization, the delicate equilibrium between decoding speed and generati…