2 papers
cs.CV2025
Two Heads are Better than One: Robust Learning Meets Multi-branch Models
Zongyuan Zhang, Qingwen Bu, Tianyang Duan +5
Deep neural networks (DNNs) are vulnerable to adversarial examples, in which DNNs are misled to false outputs due to inputs containing imperceptible perturbations. Adversarial trai…
cs.DC2025
Themis: Efficient Sparse Model Training Through Fully Sharded Sparse Data Parallelism
Yuhao Qing, Guichao Zhu, Fanxin Li +10
Mixture-of-Experts (MoE) scales large language models cost-effectively, but expert-parallel training suffers severe straggler effects from skewed expert loads. Current systems freq…