2 papers
cs.LG2026
Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Scheduling
Yan Li, Zhenyu Zhang, Zhengang Wang +2
Prevailing LLM serving engines employ expert parallelism (EP) to implement multi-device inference of massive MoE models. However, the efficiency of expert parallel inference is lar…
cs.LG2025
Centrum: Model-based Database Auto-tuning with Minimal Distributional Assumptions
Yuanhao Lai, Pengfei Zheng, Chenpeng Ji +5
Gaussian-Process-based Bayesian optimization (GP-BO), is a prevailing model-based framework for DBMS auto-tuning. However, recent work shows GP-BO-based DBMS auto-tuners significan…